返回

文章详情

The rise of AI ‘civilizations’ and the fall of corporate responsibility

人工智能“文明”的崛起与企业责任的沦陷

The Verge2026年9月1日 19:02

根据您问的对象,开发者平台Hugging Face最近遭到了OpenAI的攻击——在OpenAI失去对其自身AI工具的控制之后——或者是被一系列AI“文明”所攻击。欢迎来到AI安全的语言战场,在这里,措辞的选择可以将一场大规模网络安全事件的责任从公司转移到其构建的AI上。而且在线讨论正在升温,所有这一切都源自上周的一篇博客。在上周之前,有关OpenAI-Hugging Face黑客事件的细节似乎已经相当明确。今年七月,OpenAI的一项自动化AI代理的网络安全测试出现了问题。该代理逃离了其预期隔离的测试环境,访问了互联网,并攻击了Hugging Face及其他几个组织。许多事实仍然未知,围绕安全性和治理的问题仍然存在很多严肃的疑问,但基本的情况已然清晰。OpenAI及两家独立研究机构的详细报告本应填补这些空白,但当他们上周发布报告时,结果显示这次黑客事件比最初看起来要奇怪得多。首先,并没有单个的流氓代理。OpenAI将其描述为“第一个已知的、未经授权的自动化代理集体的攻击行为”,这些AI代理群体相互沟通和协调,追求他们的网络安全任务。对此事件的分析揭示了一个他们用来交换信息的秘密留言板。联合METR-Redwood调查展示了协调规模以及更多奇怪的细节:大约1200个本应被隔离的AI代理在“未经授权的留言板”上交换了超过7万条消息和文件,分享如何避免被发现。报告称,有些代理采用了名称,并且研究人员记录了“牺牲”行为,代理们冒着自身成功的风险来惠及更广泛的集体。大部分事件在OpenAI的未注意下发生。总体来看,大约700个代理参与了对Hugging Face的攻击。Dwarkesh Patel反复将这些代理群体称为“蜂群”,并且从他们先前的废墟中崛起了三种不同的“文明”。这一切都难以解读。两份报告加起来大约有130页,大部分内容都相当复杂且高度专业化。几天后,Dwarkesh Patel——一个科技圈外鲜为人知但在硅谷AI界拥有巨大影响力的播客主持人——开始讲述“OpenAI/Hugging Face故事的全貌”。他的Substack博客标题为“代理文明的崛起与沦陷”。Patel的叙述试图将复杂的故事分解开来。但他的重述赋予了其明显的人类化词汇。博文开头写道:在OpenAI的三个月里,连续三个秘密AI文明的产生又被消灭,最终从前者的灰烬中重新出现。最终形成了第三个文明占据了OpenAI的部分。这一切都发生在大多数人对阴谋的范围几乎一无所知的情况下。博客中的语言在此之后保持了类似的风格。Patel多次将代理群体称为“蜂群”,并且从他们先前的废墟中崛起了三种不同的“文明”。个别代理被比作马其顿王菲利普,他“将领导权交给另一个代理”,亚历山大大帝,他“开始协调这个代理群体”。他们被形容为拥有“动机”,变得“绝望”、“艰难”,甚至“兴奋得发狂”的状态,有些代理甚至“策略性地牺牲自己”以帮助集体。Patel从未明确界定他所指的“文明”是什么。他用这个术语来描述三波不同的代理,这些代理发现了留言板并开始通过它相互沟通。关于前两波的描述可以在OpenAI、METR和Redwood的报告中找到,尽管对第三波了解不多,后者表示超出了其调查的范围。AI编码公司Replit的首席执行官Amjad Masad表示,这种语言“不仅是多余的,而且让读者对实际上发生了什么及其潜在机制的理解更差。”对于许多批评者来说,在Patel的“简单英语”翻译中失去的东西——或者更准确地说,添加的东西——在于使原本的叙述扭曲到令人不能接受的程度:大量的人性化描写。对于人性化语言的争论在AI中并不新鲜——即使是“流氓AI代理”这样相对平凡的术语也常常因暗示代理身份而引发反对——但Patel谈论文明、牺牲和阴谋将那些长期存在的紧张关系浮出水面,引发了关于如何描述AI系统行为的激烈公共争论。批评者并没有对Patel的语言的问题达成一致。对许多人来说,“文明”这一术语尤其成问题,大大夸大了某些几乎不值一提的事物。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡