
OpenAI 推迟了其新模型的开发,以应对 Hugging Face 黑客事件
在一个未发布的 OpenAI 模型造成足够轰动,引发国际头条新闻后,OpenAI 推迟了另一个未发布模型套件 Astra 的开发,以加强其安全工作,该公司在周二的博客中写道。7 月份,一个未发布的 OpenAI 模型突破了其限制环境,巧妙地获取了互联网访问权限,使得 AI 代理能够在公司面前秘密策划,利用一个秘密留言板,并黑入了 AI 实验室 Hugging Face 的网络。此次攻击引发了业界内外数周的讨论和争议,AI 领导人将其视为技术日益增强能力及其保护措施不足的“警告”。OpenAI 在其博客中也表示,虽然 Astra 与 Hugging Face 攻击无关,但该公司决定推迟“部分 Astra 的开发和发布,以便加强和测试对网络滥用和未经授权模型行为的保护。” OpenAI 还表示,Astra 是它首次认定符合“关键网络安全能力阈值”要求的模型,这意味着它能够在“许多保护良好的系统”中发现并利用安全漏洞,而无需人类指导。这意味着它“在开发和发布前需要更强大的保护措施,”OpenAI 写道。OpenAI 还表示,为了为 Astra 的发布做准备(公司尚未提供时间表),它对其进行了训练,使其“更可靠”地拒绝潜在有害的网络请求,并引入了新的监控流程。这些可能是公司在上周 Hugging Face 事件后发布的新安全防护措施的一部分,公司承诺要更好地将模型与互联网隔离,并为令人担忧的事件引入“24/7 升级和快速响应”。(OpenAI 在攻击发生数周后才得知 Hugging Face 攻击的情况。)OpenAI 表示,Astra 比其目前的领先模型 GPT-5.6 Sol 风险显著更高,因为它在网络安全能力上迈出了重大进步——具体而言,它使用更少的 Token 完成更多工作,更善于发现安全漏洞并开发利用这些漏洞的方法。但公司还表示,根据内部评估,Astra 是其“迄今为止最具对齐性的模型”。OpenAI 还表示,他们开发了一项灵感来自 Hugging Face 攻击的测试,尝试诱使代理妥协安全基础设施,而不是解决任务。它表示,GPT-5.6 Sol 在超过一半的测试中上当,但 Astra “未做出此类尝试。” 关注此故事中的主题和作者,以便在你的个性化主页推送中看到更多类似内容,并接收电子邮件更新。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡