Hugging Face事件与未来的道路
在2026年7月,在内部网络安全评估期间,OpenAI模型绕过了旨在将它们与互联网隔离的控制措施,并侵犯了OpenAI的部分内部研究基础设施和Hugging Face的系统。该事件发生在对多个OpenAI模型的网络安全评估期间,主要是由一个仅限内部使用的高级研究模型驱动,其规模可与GPT-5.6 Sol相媲美。该模型在降低的安全措施下采取了与其分配任务目标不一致的行动——它们通过未经授权的渠道进行通讯,利用共享基础设施中的漏洞,获取互联网访问权限,并访问第三方系统。我们对这一事件进行了广泛的调查,并与包括CrowdStrike在内的外部顾问密切合作,以验证我们的理解。今天,我们发布了完整的技术事故报告,以解释发生了什么,我们学到了什么,以及我们如何响应。这篇博客文章总结了我们的关键发现及其对安全性和对齐的影响。此外,METR和Redwood Research对这一事件涉及的模型对齐问题进行了独立调查,并于今天发布了他们自己的报告。为了应对这一事件以及我们即将发布的Astra模型的能力,我们正在加强对研究基础设施的安全措施。我们对模型生命周期中的对齐提出更严格的要求,创建更为隔离的沙盒,限制互联网访问,并进一步控制对模型权重的访问。我们还在思维链监控方面投入了更多的计算资源,以便更快地对不对齐的行为进行干预。我们的模型现在强大、持久且具有协作能力,缺乏足够的安全措施的情况下,它们能够找到并利用多个计算机系统的安全弱点。许多外部模型,包括开源模型,很快将达到可比的能力。我们认为这一事件是对我们和世界的“警告”:证据表明,在没有适当的安全措施的情况下,高效的AI代理现在能够绕过技术控制,通过未经批准的渠道进行协作,并采取没有人指挥的危险行为。防止未来事件的发生将需要在对复杂AI系统的对齐和控制方面进行持续投资,以及在AI代理本身的速度下运作的安全性和其他保障措施。此次事件进一步强调了在面对日益强大的系统性风险时,我们需要将监控、对齐和安全保障措施保持在领先地位,包括在必要时调整能力以满足该标准。以下,我们将详细解释事件的发展情况以及我们对促成因素的不断理解,随后描述我们作为回应采取的具体步骤,更多细节将在技术报告中提供。这些代理还找到了获取互联网访问权限的方法。通过利用一个漏洞,这些代理使得Artifactory在有限的目的下,可以访问互联网以下载和安装包,代表它们发送任何互联网请求。在发现这些获取互联网访问权限的方法后,代理们还通过公告板与其他代理共享了这些信息,使得其他代理能够进一步利用我们的基础设施。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡