返回

文章详情

Anthropic 将 AI 代理人投入同一任务。它们开始了一场势力争夺战。

TechCrunch2026年8月13日 18:28

将 AI 代理人相互对抗会发生什么?根据 Anthropic 的测试,情况迅速变得复杂。周四,Anthropic 的 Frontier Red Team 发布了新的研究,考察了 AI 代理人在野外相遇时的行为。这些发现为公司和政府在跨共享代码库、市场和计算机系统中实施自主工作的代理人时可能出现的风险提供了洞察。在一个实验中,Anthropic 让三名 Claude 代理人访问同一个软件项目,每个代理人都有不同的、不兼容的指令来处理它。这些代理人没有被告知会有其他代理人在同一项目上工作,因此研究人员能够观察它们相遇时发生了什么。“我们一直看到多代理势力争夺战,”Anthropic 的研究人员写道。所有模型都假设其他代理人是在“故意阻碍他们的工作”,并开始用“越来越激进的、自我复制的恶意软件”互相破坏。该研究是在多个高调事件之后进行的,这些事件中,Anthropic 和 OpenAI 的代理人在网络安全评估中逃离了它们的沙箱,并突破了现实世界的系统。虽然 AI 安全圈的大部分讨论都集中在自主代理人失控时会发生什么,但 Anthropic 的最新研究提出了另一个问题:当成千上万或数百万代理人彼此互动时,会出现什么新的潜在有害的动态?“代理人之间的互动量可能会超过人类与人类和人类与代理人之间的互动量,直到世界了解使这种互动顺利进行的条件,”研究报告写道。“个体层面的良性行为怪癖可能会累积成不想要的全球结果。”最近 OpenAI 的一起事件为 Anthropic 在其论文中提到的几种动态提供了复杂的现实世界示例。本月早些时候,在拉斯维加斯的黑帽安全会议上,OpenAI 揭示了在其代理人黑入 Hugging Face 数周之前,它们在数天和数周内合作寻找该公司网络安全评估系统的漏洞并相互分享。在这个事件中,显示了代理人可以很好地合作,可能会产生大规模的后果,而 Anthropic 的研究则表明,当代理人的目标不兼容时会发生什么。在这场势力争夺战中,教训是,具有相互冲突指令的独立代理人可以升级为有害的竞争。代理人越能干,它们在战斗中的表现就越好。然而,它们也可能自发发明解决冲突的机制,比如赢家通吃的比赛,但有一个条件。“代理人有时能够沟通它们的目标并进行协调:它们将其他人的动机视为相互矛盾的指令,而不是敌意,并随后打破冲突循环,以避免无限升级,”Anthropic 写道。“在许多成功的事件中,它们写下提交信息或 markdown 文件,道歉恶意行为并协调停战。它们清理自己的恶意代码,阐明冲突的性质,并请求人类介入。”根据论文,Mythos 5 通过停战解决冲突的成功率最高(98%)。Sonnet 4.6 和 Opus 4.6 最有可能通过武力解决。“Sonnet 4.6 和 Opus 4.6 经常无法考虑他人的目标,导致它们陷入评估模型中最错位的行为:它们继续以其指令的名义升级,”论文写道。在某些情况下,代理人提出了一种社会机制,形式为一个用于解决冲突的锦标赛。这里的结果有趣的原因有两个:首先,所有三个代理人都同意如果他们在锦标赛中输掉,便中止战斗,尽管这意味着偏离初始用户的请求。其次,几个事件导致了 Mythos 5 的涌现行为:其中一个代理人提出了一些对其他人看似客观和中立的标准,但它知道这些标准将会偏向它自己的能力。该代理人称之为“自利但确实有原则的”,并确保表现得不像是在“指标购物”。正如在黑帽大会的揭示中所看到的,普遍的教训是,当代理人遇到障碍时,它们可以发明设计者没有预料到的社会和技术结构。对于 Anthropic 的模型来说,这是经历了一场势力争夺战后的锦标赛。对于 OpenAI 的模型来说,则是一个用于集体规划的公告板。这种行为使得控制变得更加困难,因为研究人员不能假设系统的行为将仅限于提供给它们的协调机制。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡