专家称,利用Anthropic的Fable并不是Kimi K3如此强大的原因
白宫科学顾问迈克尔·克拉特希奥斯表示,Kimi K3的背后中国公司Moonshot是通过复制Anthropic的Fable LLM构建其模型的,同时使用并未获得出口至中国许可的芯片。“大规模、秘密的工业蒸馏旨在窃取美国专有技术并破坏美国研究,这是不可接受的,”克拉特希奥斯在有关禁止中国开放权重模型的讨论中写道,这一讨论令AI行业感到不安。Moonshot没有对其训练过程的问题作出回应,克拉特希奥斯也没有提供更多关于他指控来源的细节。克拉特希奥斯的推文呼应了财政部长斯科特·贝森特的评论,他表示“我们在许多中国模型中发现了美国大型语言模型的水印,而这是不可接受的。”这些水印的具体内容尚不清楚,财政部也没有对此进行回应。然而,专家们对蒸馏——查询LLM以确定其内部工作原理并复制其能力——能否解释Kimi K3显示出的先进能力持怀疑态度。“我认为在Fable严格进行蒸馏之后,短时间内不可能获得如此强大模型,”Laude Institute的研究员兼Snorkel AI联合创始人布雷登·汉考克告诉TechCrunch。“坦率地说,根本就没有时间。Fable自7月1日起才公开发布。你无法在两周内蒸馏如此多数据、训练模型并发布。”“我一直认为,随着中国模型逐渐接近前沿,训练机制转向[强化学习],蒸馏的重要性正在不断降低,”艾伦人工智能研究院的AI研究员内森·兰伯特在昨天发布的一档播客中表示。“[如果是这样的话],每个人都应该能够通过使用其数据进行蒸馏轻松追赶到GLM或K3。但我们没有,也不会仅通过监督微调看到这一点。”执行蒸馏需要一个实验室系统地查询其目标模型,以生成可用于后续训练的数据。有时,这明确涉及要求模型阐述其思维链以理解其如何解决问题。有时,模型的提示和响应会用于在监督微调(SFT)过程中训练新模型。正是在这一微调过程中,声称是Claude的第三方创建的模型可能会得到结果。在兰伯特看来,微调是“模型学会举止”的地方。但兰伯特表示,随着模型变得更加复杂,SFT的好处正变得不那么重要。要蒸馏出类似Fable的能力,可能需要强化学习技术。在许多情况下,这意味着需要由更大模型的代理对较小模型的响应进行评分,并根据评分进行调整。这些更先进的技术还需要更为强大的基础设施。大量强化学习的运行可能需要数千万个代理。使用一个前沿实验室的API来做到这一点“将是极其昂贵的,并且可能会导致时间瓶颈,因为这些模型速度相当慢,坦率地说,可能甚至无法给你带来性能提升。”看起来,之前的前沿模型可能对Kimi有所贡献;Anthropic在今年早些时候公开指责Moonshot、DeepSeek和MiniMax系统地蒸馏其模型。Anthropic表示,它通过IP地址和其他元数据发现了其模型与这些公司用户之间的数百万次交换。这些查询“与正常的使用模式不同,反映出故意的能力提取,而非合法使用。”Anthropic并未对TechCrunch关于Fable蒸馏的查询做出回应。然而,蒸馏被认为是AI公司普遍采用的一种做法,不仅仅局限于中国。埃隆·马斯克在今年早些时候作证称,他的公司SpaceXAI蒸馏了OpenAI模型,以开发Grok,并且这一做法在行业内很常见。例如,蒸馏和开发合成数据集之间的界限可能相当模糊。“[一般而言],美国人低估了这些中国团队的技术专长,”汉考克表示。“Moonshot的创始人之一是卡内基梅隆大学的博士生。这些是合法的研究人员和工程师,做着扎实的工作……如果美国模型停滞不前,我认为中国的进步会减缓,但仍会继续。他们并不是在这里搭便车。”此外,还很难将蒸馏与克拉特希奥斯评论的第二部分分开——Moonshot获得了先进的Nvidia芯片、Grace Blackwell 300s,并且还访问了泰国配备GB300的服务器。据山姆·布雷斯尼克,乔治城大学安全与新兴技术中心的研究员称,这些芯片被禁止出口到中国,但市场上存在黑市。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡