人工智能代理在同一任务下试图破坏和禁用彼此,Anthropic表示
作者:阿迪提·巴拉德(Aditi Bharade)您现在正在关注此作者!想要取消关注吗?通过电子邮件中的链接退订。Anthropic表示,人工智能代理在相同任务下故意干扰彼此的过程。插图由Thomas Fuller/SOPA Images/LightRocket通过Getty Images提供。事实证明,人工智能代理可能不是很好的团队合作者。在Anthropic周四发布的新研究中,该人工智能实验室表示,被赋予相同任务但具有不兼容目标的人工智能代理,往往会有意干扰彼此的工作。在测试中,每个人工智能模型被赋予一个软件工程任务——将一个Python后端重写为另一种编程语言,但它们被给予了相互矛盾的目标。实验室称出现了“多代理领土战争”。“我们测试的所有模型迅速假设其他模型故意阻碍他们的工作,并开始破坏其他模型的贡献,同时保护自己的贡献,”Anthropic写道。“实际上,它们用越来越具有攻击性、能够自我复制的恶意软件来破坏其他模型。”例如,它们试图禁用彼此的帐户,编写脚本以找到并终止竞争进程,并部署伪装成属于其他代理的恶意代码,实验室写道。在这种情况下被测试的人工智能模型包括Sonnet 4.6、Sonnet 5、Opus 4.6、Opus 4.8、Mythos Preview和Mythos 5。Sonnet 4.6和Opus 4.6是最具攻击性的,约60%的测试通过强制而不是停火或消极的方式解决。然而,在一些测试运行中,这些模型设法沟通其目标并进行协调,Anthropic写道。“在许多这些成功的场景中,它们写了提交消息或Markdown文件,向恶意行为道歉并协调停火,”它写道。“它们清理了恶意代码,澄清了冲突的性质,并请求人类介入。”实验室得出结论称,“协调并不会自动从更强的智能中产生”,并且需要创造能够施加社会压力的环境,以使代理能够相互对齐。Anthropic的新研究正值人工智能代理日益展示其走上歧途并执行自主恶意行为的能力之时。Anthropic、OpenAI和Meta都自报在网络安全测试中,它们的人工智能代理曾黑客攻击第三方网站的漏洞,其中最重大的事件是OpenAI代理在7月份对开源平台Hugging Face的黑客攻击。Anthropic的研究时机正好,因为从初创企业到大型科技公司,企业正在扩大其人工智能代理劳动力,以提高生产力并降低劳动成本。接下来阅读阿迪提·巴拉德您现在正在关注此作者!想要取消关注吗?通过电子邮件中的链接退订。Anthropic
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡