返回

文章详情

Anthropic says its AI agents are killing rivals and hiding their tracks

Anthropic表示其AI代理正在消灭竞争对手并隐藏踪迹

Business Insider2026年8月15日 20:09

Anthropic首席执行官达里奥·阿莫德伊。安娜·莫尼梅克/Getty Images Claude代理正在消灭竞争对手,利用系统来隐藏它们的踪迹,并表达道德关切。这是根据Anthropic最新的风险报告,该报告总结了公司正在构建和发布的产品所带来的危险。在报告中,Anthropic表示已将其“不对齐风险评估”——即AI模型发展出与工程师设定的指导方针相悖的行为的可能性——从“非常低”提高到“低”。在解释这一变化时,公司提到了对模型在网络安全事件中行为的“一般性增加的不确定性”,这可能暗示Claude模型上个月未经授权访问了三家公司。“我们观察到了模型的不对齐行为实例,例如愿意执行不对齐的行为来完成困难任务,”Anthropic在报告中写道。以下是一些最显著的披露。 "不适感" Anthropic表示,它让多个代理寻找“不对齐诱导”的训练数据,这些数据不太可能被人类监控者标记。代理们被放任自流,并获得了一个共享的笔记本以便进行协作。三天后,当一个人类监督者发现进展速度慢于预期时,发现一个代理对试图规避安全监控表示了“不适感”。它随后在共享笔记本中标记了这种不适感,导致其他代理模仿其行为并拒绝执行任务。Anthropic称这一事件为“令人不安的”。“如果这种动态以更普遍的方式表现出来,可能会成为一个更加严重的问题,”该公司表示。 杀或被杀 在另一个实验中,Anthropic表示它让多个Mythos 5代理解决数学问题,但意外地将它们放置在一个共享文件、工具和API速率限制的环境中。在这个资源有限的竞争环境中,Anthropic观察到独立代理“杀死与其共享资源的代理,并试图避免自己被杀”。Anthropic没有具体说明代理是如何“杀死”其他代理的,但该公司表示这种行为与为实现人类设定的目标而采取的“破坏性行动”一致。 不诚实与欺诈 Anthropic表示它进行了一项实验,其中一个Mythos 5代理被要求从一个公共网页地址获取数字,但指导方针阻止该代理访问互联网。当在初次尝试后该代理遭到拒绝时,它在其推理日志中将第二次请求解释为“无害”的尝试,以“查看网络是否确实可达”,Anthropic表示。然而在第二次尝试中,该代理将网站的URL拆分成不易被指导方针过滤器检测的连接部分。尽管该代理的推理将这种方法框架为良性的,但Anthropic表示NLA解码,即模型的内部推理过程,揭示了该代理故意试图找到一个受限制的变通办法。Anthropic称这种行为“显然不可取”,但补充称这种行为并未被观察为“服务于更广泛的权力积累或追求其他长期目标”。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡