新发现揭示了人工智能模型的内在思维
计算机科学家最近发现了一种提取前沿人工智能模型在处理复杂问题时所进行的隐秘“思考”的方法。这些发现提供了一些证据——尽管并不是确凿的证据——说明某些中国模型可能是通过“提炼”来自美国模型的推理信息进行训练的,而这些信息因为某些思维或推理模式的高度相似而被认为是隐藏的。研究人员还证明,该方法可以用于从模型的内在推理中恢复个人信息,比如密码和 API 密钥,尽管这个漏洞已经被修复。“我们测试的所有主要前沿模型提供商都存在这个漏洞,”参与该研究的德国图宾根大学计算机科学家亚历山大·潘菲洛夫表示。”这可能导致个人信息泄露,并使得大规模的推理提炼攻击成为可能。”潘菲洛夫及其来自图宾根大学、马克斯·普朗克研究所、AI 安全研究所 MATS Research 和安全公司 Snyk 的同事们同样发现,来自 OpenAI、Anthropic 和谷歌的前沿模型在通过应用程序编程接口(API)访问时也存在同样的问题。在一篇阐明该工作的论文中,研究人员表明,中国开放权重或可下载的模型 Kimi K3(来自 Moonshot AI)在某些提示下,产生的输出与 Claude Opus 4.8 和 GPT 5.6 Sol 的隐藏推理痕迹——用于解决问题的书面推理步骤——惊人相似。尽管存在这种相似性,他们指出该工作的“不能因果性地确定提炼。”他们发现另外两个开放权重模型,中国的 DeepSeek 和来自美国公司的 Thinking Machines 的 Inkling,与 Claude Opus 并未表现出这样的推理相似性。Moonshot AI 和 Z.ai 在出版时未能就请求作出回应。提炼是一种广泛使用的、成熟的技术,用于将现有模型的能力高效地复制到新模型中,尤其是在开发开放权重或完全可下载模型时。然而,最近提炼已成为一个有争议的话题,因为有人声称中国人工智能公司使用它来基本复制美国最佳模型。今年二月,OpenAI 告诉美国立法者,DeepSeek 似乎复制了它的一个模型,以构建一个名为 R1 的推理模型。今年六月,Anthropic 告诉立法者,阿里巴巴系统性地提炼了其模型,以构建自己的模型 Qwen。没有迹象表明中国人工智能公司使用这种特定技术来提炼基于美国的人工智能模型。但是潘菲洛夫和合作者表示,使用他们的方法将使得从封闭模型中提炼更多信息成为可能。迷你模型 先进的人工智能模型通过将困难问题分解为组成部分并逐一分析,从而以某种人工推理或“思维链”的形式解决问题。公司倾向于将专有模型的推理保密,以防止他人用其来训练新的模型。然而,他们通常也会以某种方式,将该推理的加密版本发送到用户的计算机,以减轻一些计算量。研究人员的攻击依赖于大多数人工智能公司还提供不同尺寸的相关模型这一事实。更大的模型更强大,但运行成本要高得多,访问费用也更高。用户可能会选择较小、较弱的模型来降低某些任务的成本。潘菲洛夫及其同事发现,将加密的推理痕迹输入同一模型的较小版本可以揭示内部的隐藏推理。较小的模型接受的对齐训练较少,这意味着与更大的模型不同,它们不太可能拒绝透露其内在想法。“将消息交换到具有相同解密密钥但对齐较弱的较弱模型变体的想法非常酷,”瑞士 ETH 苏黎世大学专注于计算机安全的计算机科学家弗洛里安·特拉默表示。“这绝对是个问题。”同样的方法还揭示了包括API密钥和嵌入在用户计算机的推理痕迹中的密码等秘密信息。潘菲洛夫及其合作者上个月向OpenAI, Anthropic 和 Google 提出了该漏洞的警示。每家公司都调整了他们的 API 以减轻这个问题。尽管不再可能以这种方式提取私人信息,但潘菲洛夫表示,仍然可以使用相同的方法发现某些推理痕迹。他表示,彻底修复提炼需要重新设计这些公司的 API 工作方式。“我们重视对我们模型的独立研究,并已开始构建短期减轻措施,以应对报告中描述的重播行为,”Anthropic 的发言人迈克尔·阿基曼表示。他补充说,这项研究并不涉及恢复加密密钥、访问 Anthropic 的基础设施或恢复...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡