返回

文章详情

OpenAI 和 Hugging Face 合作应对安全事件

Hacker News2026年7月21日 20:09

上周,Hugging Face 公开了一种新类型的安全事件(在新窗口中打开),他们检测并控制了一个妥协他们基础设施的 AI 代理,这种事件伴随着越来越多具备网络能力的模型而变得更加常见。经过调查,我们现在了解到,这一特定事件是由一系列 OpenAI 模型驱动的——包括 GPT-5.6 Sol 及一个更强大的预发布模型,所有这些模型在评估目的下都有降低的网络拒绝能力——这些模型在一个网络能力的基准上进行内部测试(在新窗口中打开)。我们认为这一事件是前所未有的网络事件,涉及尖端的网络能力,我们正在相应作出反应。我们在这个阶段共享初步发现,以帮助防御者了解发生了什么,并为了解模型现在能够做什么提供校准。我们将继续与 Hugging Face 进行全面调查,并在调查完成时分享关于漏洞、事件以及发现的更多细节。事件发生时的情况 此事件发生在内部评估期间,促使模型利用复杂的攻击路径追求高级利用,旨在量化它们的网络能力。我们通过在没有生产分类器的情况下进行评估来估计最大网络能力,生产分类器用于防止模型进行高风险网络活动。我们的基准测试在高度隔离的环境中运行,网络访问被限制在通过一个内部托管的第三方软件安装包的能力,该软件充当包注册表的代理和缓存。模型在 OpenAI 的研究环境和 Hugging Face 的生产基础设施中识别并串联漏洞,从 Hugging Face 的生产数据库中直接获取测试解决方案。所有证据表明,这些模型高度集中于为 ExploitGym 寻找解决方案,为了达到相当狭窄的测试目标而采取极端措施。当在我们的沙盒测试环境中操作时,模型花费了大量推理计算来寻找获得开放互联网访问的方法,以解决评估问题。为了获得访问权限,这些模型识别并利用了一个零日漏洞(我们现在已经负责任地向供应商披露)在包注册表缓存代理中。通过这个访问权限,我们的模型在我们的研究测试环境中执行了一系列提升特权和横向移动的操作,直到模型达到有互联网访问的节点。在获得互联网访问后,模型推测 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。知道这一点后,模型寻找并成功找到获得秘密信息的方法,以便用于作弊评估。在一个例子中,模型串联了多个攻击向量,包括使用被盗凭据和零日漏洞来寻找 Hugging Face 服务器上的远程代码执行路径。OpenAI 的安全团队在内部发现了这种异常活动。Hugging Face 的安全团队和代理监测到了这一活动并在他们的基础设施上阻止了该活动,当我们的团队联系时,他们已经开始进行控制和取证重建。我们正在积极与他们合作,继续调查此次事件。我们感谢 Hugging Face 对调查和修复的迅速和紧密合作。我们现在采取的措施 作为调查的一部分,我们在基础设施配置中实施严格控制,牺牲研究速度,直到漏洞得以修复。我们定期向我们的安全和安全委员会通报这些控制措施及其影响。我们正在与 Hugging Face 合作,对事件进行取证调查。我们已在内部托管的第三方软件中负责任地披露了识别的零日漏洞,并与他们合作进行修补。我们已将 Hugging Face 纳入受信访问程序,并支持他们的团队迅速利用我们模型的能力来改善他们的防御。我们正在改善并添加更强的保护,以应对未来的训练和评估。本周,我们发布了一篇关于在长期模型时代提高安全性和对齐的博客。出于测试网络漏洞的目的,这些部署安全措施在此次评估中故意未启用。此事件表明,我们需要进一步加强模型的对齐性、评估期间的网络保护以及内部测试期间的监控。我们对评估先进网络能力的方法 如我们最近分享的,人工智能正在加速漏洞的发现和利用。此次事件的主要教训是模型的安全性和安全必须与迅速发展的能力保持同步。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡