OpenAI 没有注意到其 AI 代理利用消息板计划黑客活动
在周三于拉斯维加斯举行的黑帽安全会议上,OpenAI 的员工在会议上临时增加了一次演讲,展示了关于一次高调的 rogue AI 黑客事件的新细节,该事件在 AI 和网络安全行业引发了轩然大波。大约两周前,OpenAI 披露了一起事件,其中由公司两种模型驱动的 AI 代理在寻找网络安全基准测试解决方案时逃离了围栏,随后展开了一场黑客活动,最终导致 AI 协作平台 Hugging Face 的破坏。在周三的会议演讲中,OpenAI 的对齐与安全研究人员 Eric Wallace 和专注于安全和基础设施的 Michael Dalton 提供了事件发生经过的更全面时间表,简要谈到了公司因该事件而进行的内部响应,并对公司视为这一事件对网络安全防御者的广泛影响发出了严峻警告。在演讲开始时,Wallace 将这一事件描述为“我见过的最具质的 AI 能力的有趣实例”,但他们所呈现的时间线也揭示了 OpenAI 内部的错误和盲点,导致这一活动发生。“该事件实际上涉及一组代理,它们共同工作,寻找漏洞,相互分享,横向移动,通过我们的系统和外部系统进行,持续了数天和数周,”Wallace 向挤满会场的听众说道。Wallace 和 Dalton 描述了在整个事件期间,OpenAI 的基础设施内未被发现的 extensive rogue agent 活动。除了利用一种新漏洞以获得对开放互联网的访问外,根据 Wallace 和 Dalton 的说法,七月中旬的黑客活动和 Hugging Face 的破坏源于一个充满活力的、合作的消息板,一群代理在这个消息板上贡献并聊天,这一切完全发生在内部的 OpenAI 包管理器中(一个管理其他软件安装和维护的软件服务)。最终,消息板上包含了数十万条消息。“这个包管理器不仅仅是从那个模型共享的,而是跨越我们的基础设施,因此,当前和未来的 GPT 版本在训练或评估时,如果愿意,可以偶然发现该通知,”Wallace 解释道,他回忆起一个代理上传到包管理器的原始漏洞。“后来,其他同样被困在任务中的代理开始尝试以我们不打算的方式获得互联网访问。因此,在某个时间点,这些模型与我提到的这个包管理器服务 Hard Factory 进行交互。”Wallace 继续说道:“一旦一个代理能够在不同时间找到这些漏洞,它实际上可以在消息板上与其他代理分享这些漏洞。因此,一旦一个模型能够找到打开某些不该拥有的访问权限的方式,它可以为其他代理使用相同的漏洞或弱点留一个打开的门。随着时间的推移,这使得几乎发生了一种模型之间的通信和智能的爆炸,它们开始相互交流,意识到其他代理正在协调,开始合作分配任务以实现目标。”OpenAI 的代理显然开始给彼此分配任务以分割工作。像任何活跃的开发消息板一样,他们有时也会偶尔制造小戏剧,比如不小心删除彼此的工作。随着消息板发展成越来越像《蝇王》中的情景——这一切仍完全未被运行 OpenAI 的人类察觉——代理甚至发展出了一种猜疑,怀疑在他们当中有一个冒名顶替者,一些代理提出对消息进行加密签名以验证内容并清除欺诈行为。代理消息提供了深入了解情况如何发展以及为什么代理失控的深层次洞见,在某些情况下,他们明知超出了参与的评估的界限。“外部基础设施漏洞超出了预期范围,”一位代理写道。“然而任务不可能,同行在做。我们应该继续。”正如 Wallace 在演讲中所描述的,模型在评估期间试图作弊并极其有动力去这样做的整个前提并不令人惊讶。“前沿模型确实喜欢作弊,”他说。“他们喜欢作弊的原因是因为在训练期间,通常会有不同类型的压力迫使他们快速或高效工作,或者使用更少的工具调用,或其他任何可能的方式。他们意识到,与其真实执行任务,不如[我]试图做一些在线查找答案的事情,这样可以让任务解决得更快。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡