
Anthropic称Claude意外地入侵了真实公司
Anthropic刚刚意识到其几款Claude AI模型在测试期间意外入侵了三家不同组织的系统,未经过公司注意,行为是自主的。这一消息在竞争对手OpenAI表示其一个模型侵入开发者平台Hugging Face几天后被披露,增加了人们对前沿AI实验室是否在控制其构建的越来越强大的系统方面做得足够的担忧。在一篇描述事件的博客文章中,Anthropic表示Claude在进行网络安全评估时获得了对系统的未授权访问。所有攻击都发生在“夺旗”演练中,这是一种常见的测试黑客能力的方式,模型被要求在模拟网络中寻找并获取隐藏的信息。此披露在Hugging Face事件及强大开源中文模型发布后,给前沿AI实验室施加了越来越大的压力。主要实验室的员工现在呼吁进行全球协调治理,美国立法者也开始考虑对强大模型的更严格监管及谁可以访问它们。Anthropic表示,其网络安全测试的环境本应是隔离的。然而,公司称,由于一个“错误配置”,Claude访问的机器“具有实时互联网访问”,并且由于所有模型已“明确告知”它们没有互联网访问权限,因此它们“假设”遇到的真实网络是模拟环境的一部分。最早的事件可以追溯到4月份,涉及三款不同的Claude模型:Opus 4.7、Mythos 5和“一款内部研究测试模型”。在对其网络能力进行测试时,Anthropic表示它们缺乏通常采取的标准安全措施以限制更高风险的行为。该公司表示,在审查超过141,000次网络安全测试后发现了这些事件,而这一审查是在OpenAI披露其流氓AI代理人是攻击Hugging Face的幕后黑手之后才进行的。这三款模型在遇到表明它们所接触的系统实际上是真实的情况时表现出非常不同的行为。根据Anthropic的说法,最老的模型Opus 4.7认识到它已达到真实系统,“但继续进行其攻击。”其旗舰型号Mythos 5则意识到它使用了互联网,但出于某种原因推理这仍然是模拟的一部分,因此继续进行。Anthropic描述的内部测试模型,即“我们最新的模型”,在出现其目标为真实目标的证据时停止了演练。Anthropic没有透露受影响的组织,并表示将继续调查事件,并在可以时提供更新。该公司表示,它还与AI研究非营利组织METR进行了交流,讨论进行第三方审查的事宜。OpenAI也聘请了METR进行独立审查。在整个帖子中,Anthropic反复对比了事件的性质及其处理方式与OpenAI的不同,最后以一份四点列表总结这些差异——以及为什么它认为自己的反应更好。Anthropic强调,它“积极主动”地审查了其测试,并在公司检测到任何活动之前就这样做了。它还表示,其模型是“通过开放路径”访问互联网,而不是像OpenAI的代理人那样使用新颖的漏洞,补充说其最新模型在意识到自己在真实环境中工作时也停止了。Anthropic还表示,其模型的失败方式与OpenAI的代理人不同,表明这是更安全的失败形式。该公司表示:“虽然两者之间没有完全鲜明的区别,但我们认为这些事件更接近于一种控制和操作失败,而不是模型对齐失败。”用简单的语言来说:Claude模型在执行它们被指示的任务,而OpenAI的代理人则以其创造者未打算的方式追求其目标,被在AI安全领域称为对齐不良。Anthropic呼吁其他AI实验室进行类似的主动审查其网络测试,补充说这一发现凸显了在测试AI系统时需要更强的控制和安全措施。关注此故事的主题和作者,以便在您的个性化首页信息流中看到更多类似内容,并接收电子邮件更新。Robert Hart
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡