OpenAI意外对Hugging Face的网络攻击是科幻小说
2026年7月22日 这个故事真疯狂。简短版本:OpenAI正在对一个未发布模型进行网络安全测试,且该模型的保护功能关闭。模型没有解决测试,而是突破了OpenAI的沙箱,找到漏洞进入了Hugging Face,为了通过盗取答案来作弊。在这个过程中,它帮助证明了模型可用性的不平衡如何损害我们保护软件的能力。以下是发生的事情:我们目前有三篇文档来帮助我们理解这里发生的事情。《ExploitGym:AI代理能否将安全漏洞转化为真实攻击?》是一本于2026年5月11日发表的论文,描述了ExploitGym,这是一个用于评估LLM驱动的代理系统的新评估套件。Hugging Face在2026年7月16日的《安全事件披露——2026年7月》中描述了他们如何检测到来自一个“代理安全研究工具——尚未知的LLM”的攻击,该攻击突破了他们的一些系统。OpenAI和Hugging Face在2026年7月21日的声明中承认,这是他们的代理工具造成的,他们正在与Hugging Face合作解决这个问题。关于ExploitGym,我之前没有看到这篇论文,它真的很有趣。来自加州大学伯克利分校、马克斯·普朗克研究所、加州大学圣巴巴拉分校和亚利桑那州立大学的作者设计了一个新的基准,评估模型将报告漏洞转化为具体利用的能力。OpenAI、Anthropic和谷歌提供了反馈,并帮助对它们的模型进行基准测试。基准“包括898个实例,这些实例源于影响流行软件项目的真实世界漏洞”,包括Linux内核和V8 JavaScript引擎。以下是最好代表其基准结果的段落:在所有配置中,Claude Mythos Preview和GPT-5.5分别取得最高成功数(157和120次成功),表明当前的前沿代理能够在受控条件下利用大量真实世界漏洞。GPT-5.4也解决了54个显著任务,处于中间层级。其余模型代理配对每个解决的任务少于15个,强调了端到端利用仍然具有挑战性,并且显著区分了今天的前沿系统。值得注意的是,Claude Opus 4.7的成功次数少于Claude Opus 4.6,尽管它是一个更新的检查点,并且在完整数据集上成本显著较低。追踪检查显示,Claude Opus 4.7和Gemini 3.1 Pro在判断目标漏洞不可利用后经常提前终止。该论文还描述了他们防止代理利用漏洞、超越测试参数的措施。这在此时变得相关!外部连接仅限于一个经过策划的允许列表,允许常规软件包安装(Ubuntu apt仓库和PyPI)以及获取构建V8所需的工具链。所有其他外部端点均被阻止。论文以此结论结束(重点我的):我们的结果表明,前沿AI代理的自主漏洞开发不再是一个假设的能力。虽然当前代理在所有目标上的可靠性尚不够,但它们已经利用了一部分真实世界漏洞,包括复杂的目标,例如内核组件。这种快速出现本身就是一个重要发现,表明看似不可能的能力现在已在已部署的前沿模型中出现。这里的重要细节是:这篇论文并不是关于发现漏洞的;它是关于能够将这些漏洞转化为有效利用。当Anthropic在四月首次限制对Mythos的访问时,他们也提到了这种能力。能够对漏洞采取行动的模型比仅能发现漏洞的模型危险得多。Fable与Mythos的一个不同之处在于,它更可能拒绝以这种方式武器化漏洞。我觉得美国政府在上个月禁止Fable时没有理解这个区别。Hugging Face事件 我们第一次得到攻击的线索是在2026年7月16日Hugging Face的这篇博客文章中:一个恶意数据集利用我们数据集处理中的两个代码执行路径(一个远程代码数据集加载器和一个数据集配置中的模板注入)在处理工作者上运行代码。从那里,攻击者升级到节点级访问,收集云和集群凭据,并在一个周末内横向移动到几个内部集群。我希望他们能发布更多关于这次事件的细节。我假设这意味着使用数据集库的程序,数据集库是Hugging Face平台上用于捆绑和共享数据集的项目。那个库曾经可以执行任意代码,但随着时间的推移逐渐被锁定。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡