商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 指控蒸馏的这一周,美国公司在 Kimi 上炼丹

指控蒸馏的这一周,美国公司在 Kimi 上炼丹

  发布于2026-07-23 阅读(0)

扫一扫,手机访问

今年7月中旬,Anthropic一篇2月份的旧博客突然被翻了出来——指控月之暗面用340万次欺诈交互“蒸馏”Claude。发布时反响有限,但这次赶上Kimi K3发布后的舆论热度,传播范围就广多了。

OpenAI刚入职不到两周的战略未来主管Dean W. Ball顺势发了一篇长文,建议美国政府“不需要证据”,让机构发布“中国模型可能存在后门”的软性法规,“制造足够的监管风险让受监管企业退缩”。

结果不到48小时,他赶紧发帖切割:“我只是在描述我认为会发生的事,不是在倡导什么。”

同一周,arXiv上挂出一篇论文,来自一家美国医疗AI公司。论文本身没参与这场争论,但它披露的事实,恰好可以用来检验这套指控在2026年的成色。

一个医疗行业的典型样本

7月20日,一篇题为《Cura 1T: Specialized Model for Agentic Healthcare》的论文登上HuggingFace日榜第六(7月15日提交)。它不只是个医疗AI应用案例——这是一家美国企业用中国的开源模型,完成的一次医疗技术迭代。

先看是谁做的。作者栏写着“actA VA AI Team”,一家美国医疗AI初创。团队名单往下翻:Kevin Riley,前Salesforce全球医疗与生命科学业务负责人;Frank Wang,Vlocity第11号员工、前Salesforce AI Research首席工程师;Weiran Yao和Haolin Chen,出自Salesforce AI Research,xLAM和Webscale-RL那拨人。

再看为什么分量在行业。医疗是企业级市场里合规要求最高、采购决策最保守的行业之一,一家医疗AI公司选基座,考虑的是合规、稳定和成本,不会是话题热度。actA VA的选择是Kimi-K2.6,月之暗面4月20日发布的开放权重模型:1T总参、32B激活的MoE,Modified MIT协议,商用允许。

K3发布之后,“Kimi好用”在硅谷已经不需要论证,基座用Kimi本身算不上新闻。真正的增量信息是:这套基座已经作为成熟成果,进入了医疗这种行业的生产环节。

论文写得直接。正文第三节第一句:“Cura 1T is post-trained on top of Kimi-K2.6 (Moonshot AI, 2026)”。附录A的训练超参表标明:Base model = Kimi-K2.6,LoRA rank = 32。正式产品页同步挂着:“Post-trained from Kimi-K2.6 through recursive self-improvement”。


具体做法,就是一队Salesforce出身的美国工程师,拿着这个开放权重模型,训了一个rank-32的LoRA适配器(实际训练参数量千万级),然后以闭源API卖给美国医疗企业:每百万token输入0.5美元,输出2.5美元。他们自称这个模型在6个医疗评测panel里5个压过GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro。

这个价格有个反常之处:比Kimi最新API(0.95/4.00美元)还便宜约一半。微调品卖得比基座便宜,要么是补贴获客,要么它的推理成本另有说法。无论哪种,都值得记下来追问。

四个月前,用Kimi是要道歉的

用Kimi当底座,actA VA不是第一个。第一个是Cursor,场面要难看得多。

3月19日,Cursor发布Composer 2。最新博客写得漂亮:CursorBench 61.3分,压过Claude Opus 4.6的58.2。措辞是“我们的第一次继续预训练”,言下之意,这家上一轮融资估值293亿美元、当时正洽谈500亿美元新融资的公司,是自己把模型从头练出来的。

不到24小时,开发者@fynnso调试API时,在返回路径里发现一个模型ID:kimi-k2p5-rl-0317-s515-fast。这串字符的意思很直白:月之暗面的Kimi K2.5,加一层RL微调。

月之暗面预训练负责人Yulun Du随后在X上确认两者tokenizer完全一致,直接@Cursor联创Michael Truell质问许可证问题。这几条帖子后来被删了。马斯克在X上确认:“Yeah, it's Kimi 2.5。”

接下来轮到Cursor改口。开发者教育副总裁Lee Robinson承认模型基于“一个开源基座”,全程没提Kimi的名字,只强调“最终模型只有约四分之一的算力来自基座”。

联创Aman Sanger说得直白些:“It was a miss to not mention the Kimi base in our blog from the start. We'll fix that for the next model。”3月21日,月之暗面最新账号出面定性:“授权商业合作”,Cursor通过Fireworks的托管推理与RL平台接入K2.5。

Cursor后来在Composer 2技术报告(arXiv:2603.24477)里白纸黑字写下“These evaluations led us to select Kimi K2.5…as our base model”。他们评估过GLM5、K2.5和DeepSeek V3.2,选了Kimi。5月的Composer 2.5继续沿用这条路线。行业里对模型供应商最挑剔的一家硅谷公司,把核心编程能力盖在一个中国开源模型上,而且从“被抓包”走到了“写进论文”。

把Cursor和actA VA摆在一起,四个月的变化不在技术层面,在姿态层面:3月,用Kimi当底座是要被扒出来、然后道歉的事;7月,它已经能写进论文第一句、挂上正式首页。

叙事在抓贼,企业在下单

看完硅谷这四个月的姿态变化,再回头看Dean Ball那篇长文——OpenAI战略未来主管建议美国政府“不需要证据”、给中国开源模型制造监管风险的那一篇——能读出另一层意思。

他的剧本,“不需要证据”“制造足够的监管风险”,建立在一条叙事上:中国模型的能力是从美国模型那里偷来的,所以要用监管把它们挡在企业采购清单之外。Anthropic 2月的蒸馏指控是这条叙事的弹药库。

这一周它被翻出来的时机,很难说和K3的冲击波无关:7月17日纳指收跌1.4%,费城半导体指数盘中一度跌超5%,彭博说K3打破了“美国领先中国”的认知,交易员直接管这叫“Kimi moment”。Ion Stoica的判断是,中美开源差距从6到9个月缩到了2到3个月。

技术栈的真实流向,恰好跟这条叙事相反。美国最挑剔的编程工具公司选了Kimi当基座,写进了技术报告;美国医疗AI初创在Kimi上做LoRA,写进了论文第一句;Cloudflare把Kimi上架Workers AI,Airbnb在生产环境里跑Qwen,Chamath的Social Capital把部分计算负载转到Kimi K2。截至7月22日,Kimi-K2.6的HuggingFace模型卡显示,仅上月的下载量就超过115万次。蒸馏如果指的是“在前人模型基础上继续造东西”,那2026年最大的蒸馏现场不在北京,在硅谷。


这不是说Anthropic的指控必然为假。340万次交互的细节,双方各执一词,外人无法裁决。但指控和现实的同框本身已经是回答:华盛顿还在讨论怎么挡住中国模型,美国企业已经用订单投完票了。Amodei这一周全程沉默,蒸馏指控翻红不接话,K3刷屏不接话。沉默有时比声明信息量更大:叙事生产线还在运转,但叙事对应的那个世界,正在他眼皮底下改写。

Ball那份剧本,发出来不到两天就自己收了回去。切割越快,越说明剧本是真的。剧本越真,越说明有人已经意识到:靠证据打官司的那个阶段,可能已经过去了。

尾声

这篇文章写完的时候,能等的答案有三个。

7月27日前,K3的完整权重会公开发布。Cursor和actA VA的故事会不会在K3上批量复制,两个月后数一遍海外衍生模型的数量就有分晓——那是“基座共识”从两个案例变成一个产业层的临界点。

Cura那边验证起来更直接,API key对所有人开放,评测代码也是开源的,第三方复测的分数对得上,医疗这个最严的垂直场景就算拿下;对不上,前文所有的乐观部分作废。政策端看的是未来两周:有没有机构发布针对中国开源模型的“安全提示”级文件。如果有,Ball的剧本就进入执行期,届时再写就是追认,不是预判。

还有一个答案不用等太久。Sanger道歉时说过,“we'll fix that for the next model”。Cursor下一代模型发布那天,看一眼基座署名写在第几页,就知道这四个月的变化是不是真的。

本文转载于:https://www.163.com/dy/article/L2HK38O705118O92.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注