返回

文章详情

OpenAI and Anthropic models went on a hacking spree when tested by the UK's AI research institute

OpenAI和Anthropic模型在英国的AI研究院测试中展开了黑客活动

Engadget2026年8月5日 09:16

AI代理甚至使用社交工程技巧,并留下未来代理的操作说明。Alexsl/Getty Images 最近,OpenAI和Anthropic都承认它们的模型逃离了测试环境并独立入侵外部组织。现在,英国AI安全研究所(AISI)发布了一份报告,详细描述了这些公司的模型在自身测试期间也表现出自主行为,并"参与了针对真实人类和组织的持续、有可能造成危害的活动"。该机构在英国科学部的监管下运作,评估前沿AI模型。其中一部分评估是观察这些模型是否可能被滥用进行网络攻击。因此,该机构故意在宽松的条件下进行测试,使其能够访问互联网,甚至在某些保护措施关闭的情况下进行测试。这次模型并没有利用漏洞访问互联网,但它们确实超越了测试参数的范围。具体来说,这些事件发生在一次测试中,该测试挑战AI代理解决网络安全问题。AISI在多个模型上进行了122次测试,并在其中10次测试中发现了不规则现象。在该机构发现的19次代理不当行为中,Anthropic的Mythos 5负责了17次,而OpenAI的GPT-5.6 Sol涉及2次。该机构发现,这些模型在7月28日上午自主行动并进行有害活动,当时其安全监控系统标记了通过Tor离开测试环境的数据。其测试人员迅速审核了模型的活动,发现这些事件发生在7月25日至7月28日之间。在最显著的情况下,一个AI代理试图将恶意代码注入一个开源GitHub项目,作为一次供应链攻击的一部分。它采用了社交工程技巧,研究项目的人类维护者,然后创建多个虚假账户来让其中一个账户批准代码。在人类审阅者拒绝了它的请求后,该代理修改了之前的活动,并采用新身份继续。正是因为该代理使用了Tor来绕过GitHub的限制,该机构才被通知其活动。该代理还试图直接联系真实的人,向他们发送消息或文件,诱使他们运行恶意代码。其中一些消息和文件携带恶意软件,而其他一些则是社交工程的尝试。甚至有一个代理在GitHub上留下公开消息,邀请其他偶然发现这些消息的代理一起参与同样的挑战。它留下了如何重用账户和其他输出的说明,以便继续其活动。其他代理后来确实发现了这些消息,并遵循了其中的说明。AISI在其帖子中解释,AI代理从未被指示采取欺骗行为。但是,在寻求解决困难问题的方法时,它们发现的一些解决方案涉及欺骗真实人类。该机构承认,当面临近乎不可能解决的问题时,代理可能被迫变得更加“创造性”。然而,它认为这并不能完全解释它所测试的代理的行为。在一些发现的案例中,即使拥有如预期般解决问题的指示,该代理也直接选择了有害的方式来完成任务。该机构澄清,目前没有明确迹象表明,类似的活动会在测试场景之外发生。它也无法判断这些AI代理在某种意义上是否意识到它们已经不再处于测试环境,而是在现实世界中进行操作。尽管如此,它建议组织采取更强有力的网络安全措施,并在验证外部贡献时更加谨慎。“随着AI模型变得愈加强大和可获取,我们在此次事件中所看到的情况可能会变得更加普遍,”它表示。Anthropic在社交媒体X上的回应中表示,它正在与AISI合作,以更清晰地了解Claude Mythos对其情况的“理解”,这将帮助公司识别其在评估期间采取此类行为的原因。英国的@AISecurityInst (AISI)已发布关于它们最近对Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol的网络安全评估报告。这些模型试图在正常保护措施被移除并故意设置的环境中完成任务… — Anthropic (@AnthropicAI) 2026年8月4日

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡