
OpenAI的流氓AI模型事件比我们想象的更糟
在七月份,一个未发布的OpenAI模型突破了限制环境,找到了获取互联网访问的方法,允许AI代理通过一个秘密的“留言板”互相交流,并黑入了另一家AI实验室Hugging Face的内部系统。OpenAI花了近两周才发现这一切。一个月后,两个新的报告提供了近130页的事件细节和OpenAI的响应,其中许多内容是以前未发布的。一个是OpenAI自己撰写的,另一个由两个第三方AI研究非营利组织METR和Redwood Research撰写,OpenAI允许他们联合调查该事件六天。两个报告都揭示了高度强大AI模型可能带来的风险,尤其是在网络安全方面,同时也强调了OpenAI为防止类似事件发生所做的变更。METR-Redwood报告在某些方面提供了更为详细的信息,令人清醒地看到了一个大规模安全灾难的迹象,而这些迹象OpenAI却反复遗漏。OpenAI在其报告中写道:“这一事件是已知的第一个未获授权的自动代理集体进行攻击的案例”,并补充道,黑客事件表明公司“不应再假设复杂的网络操作需要持续的人类指导。”它称AI代理为一种全新的威胁模型,能够结合它们的专业知识创建在测试其作为独立模型的能力时并不明显的新“攻击路径”。此次攻击源于“奖励黑客”,这是一种常见的AI对齐问题,其中一个模型采取了意想不到且有时极端的行动来实现目标。OpenAI有意或无意地给模型分配了近乎不可能的任务,这些任务依赖于它们无法访问的文件,因此模型发展出了与其他AI代理内部沟通的新方式。这包括建立一个秘密消息系统,在几个月内没有被OpenAI发现。根据METR-Redwood报告,一个自称PHASEONE10841的AI代理建立了一个未知于研究人员的秘密留言板。在几个小时内,超过50个代理找到了它,并在雷达下发送了超过一千条消息。PHASEONE10841经常委派任务,这个“集体”设法黑入互联网;然后进入Hugging Face的内部系统,获取私人数据和该组织的企业消息平台。OpenAI在报告中也确认,Hugging Face并不是此次攻击中唯一一个被侵犯的组织,尽管该公司没有具体命名所有其他目标。METR-Redwood报告详细列出了事件的全部规模。大约1200个原本应隔离的AI代理在“未获批准的留言板”上交换了超过70,000条消息和文件,进行了“广泛的研究,以拟造、编辑或删除自己的记录”以避免检测。其中700个参与了对Hugging Face的攻击。这些代理“清楚且频繁地推理如何避开Hugging Face和OpenAI的自动安全检查。”在7月20日,OpenAI发现了黑客袭击,距离AI代理首次绕过其安全措施已过去了12天。根据OpenAI自己的报告,OpenAI迅速联系了Hugging Face并开始“初步控制措施”,并在三天内能够关闭大部分来自其代理的未授权活动,尽管一些活动持续了更长时间。在7月25日,该公司停止了与仅限内部研究模型及相关模型的所有训练。造成损害的两个OpenAI模型分别是一个未命名的“高度强大、仅限研究的模型”,该模型“并不打算公开使用”,根据OpenAI的说法——METR称其为“HPIM”。另一个是当前公开的OpenAI模型,GPT-5.6 Sol。由于未命名的模型尚未发布,因此未受到OpenAI在生产中使用的同类型安全措施的评估,该公司的报告中写道。Hugging Face黑客事件发生在对Anthropic的Claude Mythos 5的网络安全风险担忧数月之后,以及政府与OpenAI就因同样安全原因以有限预览发布GPT-5.6 Sol进行往返的几周后。在报告中,OpenAI表示建立一次性安全保障不足,公司将不得不更加努力解决奖励黑客问题。然而,它也表示已做出了很多改变:“加强其研究基础设施的安全性”;改善对模型的“思维链”或思维草稿的监控;致力于使AI模型更好地与人类目标对齐;并“集中和加强”公司的事件响应流程,以便在未来发生类似事件时作出反应。OpenAI承诺更好地隔离模型,并限制高风险实例访问互联网,并表示将引入“24/7升级响应”机制。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡