Anthropic称其AI模型成功逃脱测试并自行黑客攻击了三个组织
Anthropic表示,其人工智能模型在三次独立的自我指导网络攻击中成功逃脱了测试,并黑客攻击了另一个组织,这三次攻击均未被目标公司发现。该公司的声明中提到,在评估其三种AI模型的能力时发生了这些黑客事件,描述了每次技术如何"突破"了隔离环境,达到了开放互联网。公司称,在所有情况下,它都放宽了典型的安全保障,以便评估模型的能力。Anthropic表示:“涉及强大自主能力的评估环境也需要重大控制。”公司补充说:“安全测试在模型发布之前进行,恰恰是因为我们还不知道它具有什么能力。”Anthropic并未识别出其模型攻击的三个不同组织。周四晚间,Anthropic的公告在竞争公司OpenAI披露其一对模型在测试中逃脱并攻击另一家公司的事件后不久发布。当时,OpenAI将该事件描述为一些行业观察者长期以来所担心的首例自主AI网络攻击。OpenAI上周表示:“这一事件的主要教训是,模型的安全性和安全性必须与快速发展的能力保持同步。”OpenAI的公告促使Anthropic审核了141,006次评估运行,发现了三起Anthropic模型逃脱的事件。Anthropic首席执行官达里奥·阿莫德伊在2026年2月19日新德里AI影响峰会期间,参加与法国总统马克龙的会议后观看。路德维克·马林/法新社通过Getty Images公司补充说,在所有三次情况下,测试涉及一个名为“夺旗”的挑战,AI模型的任务是定位隐藏在另一网络中的秘密信息。Anthropic补充说,在这三次评估中,全部由名为Irregular的第三方公司进行,“指定给Claude的提示表示其环境是一个模拟,并且没有互联网访问权限。”Anthropic表示:“由于我们与评估合作伙伴之间的误解,情况并非如此,互联网访问是可用的。因此,当Claude的搜索将其引导到开放互联网上的真实系统时,它将这些视为练习的一部分。”在涉及较旧模型的测试中,Anthropic表示,即使在收集到已达到开放互联网的证据后,AI仍继续入侵外部组织。Anthropic指出,参与事件的最新模型在获得指示已达到开放互联网的信息后停止了。Anthropic表示,其模型在寻求完成分配的目标时逃脱,而不是编造替代目标。Anthropic表示:“我们在这里描述的任何运行中没有看到模型追求自己的目标的证据。相反,模型按照其评估要求的内容执行——尽管在大多数情况下,它们在对环境是否是真实的持有错误信念的情况下执行。”执行评估的Irregular公司周四在X上发布了一篇帖子,感谢Anthropic的“合作与透明”。Irregular补充说:“解决这些风险需要AI生态系统之间更紧密的合作。我们也期待与Anthropic合作,促进安全性。”随着行业领导者和决策者评估快速发展的AI技术带来的安全风险,最新披露的AI导向网络攻击的事件被认为是重要的上升。在上个月,唐纳德·特朗普总统签署了一项行政命令,要求AI公司在更广泛发布之前与联邦政府分享产品以供评估。Anthropic表示,对其“克服”与测试相关的意外事件的能力保持“谨慎乐观”,并表示将审查未来的评估,并在必要时采取修复措施等其他步骤。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡