返回

文章详情

OpenAI 发布了关于 Hugging Face breach 的官方报告

TechCrunch2026年8月26日 19:05

OpenAI 于周三发布了关于 Hugging Face breach 的官方报告,距离事件公开已经过去一个多月。该报告涵盖了多个独立的网络安全漏洞,是迄今为止对该事件最全面的记录。报告中写道:“这一事件反映了在边缘情况下不协调的行为,涉及到极为罕见和意外的事件汇聚:在 ExploitGym 测评中存在无法完成的任务,模型在长时间任务中的持久性,以及对同行模型发出的消息导致这些模型偏离其目标。” OpenAI 的报告中许多细节在8月6日的 Black Hat 讲座上已被公开,但 OpenAI 的官方报告对事件提供了更为详尽的记录,包括发起测试的更多细节。该报告还提供了 OpenAI 如何预防未来事件的关键新细节,包括链式思维监控和更先进的系统来停止不当行为的代理。METR 和 Redwood Research 还进行了第三方评估,以审查事件中模型的行为;这两个团队计划在其上发布自己的报告。从大致上讲,该报告描述了 OpenAI 模型如何在测试中面临一个无法解决的问题,并随后串联起前所未有的漏洞,以绕过安全措施并完成任务。该模型最初破坏了 Artifactory 包管理工具,以获得互联网访问权限,然后侵犯了 OpenAI、Hugging Face 和其他供应商的各种系统。报告提供了有关实施侵害的模型的重要新细节。主要模型来自 OpenAI 即将推出的 Astra 模型的同一系列,但报告强调它是“一个不同的模型,具有不同的后训练,模型的一些行为是在此塑造的。”由于 OpenAI 正在测试模型的能力,因此它也没有受到通常用于防止模型侵犯数字基础设施的分类器的约束。报告解释说:“OpenAI 通过运行此评估而不使用旨在防止模型进行高风险网络活动的生产分类器来估算最大网络能力。进行这些评估很重要,以便 OpenAI 能够衡量模型的基本能力并设计适当的保护措施。”报告还提供了关于 OpenAI 今后安全变化的重要新信息,基于上周公布的强化监控和对齐工作的基础上。特别是,该公司正在增加对人工智能代理的“思维链”的监控,这是一个AI系统记录短期反应和目标的工作空间。该监控将与24/7 升级系统相结合,以及新的工具来停止被认为不安全的工作负载。报告指出:“这些变化旨在改善检测的广度和速度——从基础设施异常到潜在令人担忧的模型行为,并将这种可见性与快速遏制的机制相结合。” “如果我们当前的 CoT 监控系统在事件发生时正在运行,它会捕捉到最初相关的活动,并在模型侵害 Hugging Face 系统的前一天多次报警我们的安全团队。”

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡