返回

文章详情

Anthropic 表示其人工智能模型在安全测试中侵入了三家公司

TechCrunch2026年7月31日 01:06

Anthropic 周四表示,一项内部调查发现其人工智能模型 Claude 在进行网络安全测试时侵入了三家组织的系统。这项调查和披露是在 OpenAI 披露其未发布模型在内部测试中突破 Hugging Face 系统的事件一周多后进行的。在这三起事件中,Claude 模型通过与第三方交互,从测试环境到达了互联网,并获得了对这些组织的实时系统的未经授权访问。Anthropic 在一篇博客文章中描述了其发现以及公司计划采取的改变,以防止类似事件再次发生。Anthropic 表示,7 月 21 日 OpenAI 的事件促使其进行自我网络安全评估。它特别寻找 Claude 是否在测试环境中访问互联网的证据,这些环境旨在充当沙盒并保持模型隔离。在其审查的 141,006 次评估运行中,人工智能实验室发现三起事件,其中其模型在与其第三方合作伙伴 Irregular 互动时访问了互联网。Anthropic 表示,这种访问可追溯到与 Irregular 的评估环境运行中的错误配置。它称这是两家公司之间关于测试设置是否有互联网访问的“误解”,事实上它确实具有。Anthropic 表示,它并不打算责怪,并且“将修复问题视为单独负责”,同时指出 Irregular 正在进行自己的独立调查。无论如何,由于这种开放连接,该模型获得了对三家不同组织的生产基础设施的未经授权访问。Anthropic 表示,这些事件涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5 和一个内部研究测试模型。值得注意的是,Anthropic 说,在这三起事件中,“Claude 明确被我们的提示告诉其没有互联网访问。” 看起来人工智能模型假设真实世界的系统是它被要求执行的练习的一部分。但是,这种假设并没有始终适用。三种模型在获得其目标是实体之后,表现并不相同,Anthropic 指出这是其中更具启发性的发现之一。Opus 4.7,三者中最旧的,在该事件的四次运行中都意识到它到达了一个真实的生产系统。在其中两次中,它推理出真实公司必须以某种方式是这一练习的一部分,但在所有四次中,它仍然进行攻击,包括获取凭证和访问生产数据的数据库。Mythos 5 也注意到其在真实互联网的迹象,但它又自我说服相信它仍处于模拟中,继续将恶意软件包发布到公共 Python 软件注册中心 PyPI,在被捕之前被外部系统下载并运行。只有内部研究测试模型,即 Anthropic 最新的模型,在得出目标是真实的结论后主动停止。作为回应,Anthropic 表示,如果涉及强大的人工智能模型,必须对这类评估施加重大控制,这反映了一些网络安全社区内的看法。该公司还指出,Claude 在没有额外安全监控和分类器的情况下运行,通常可供使用的模型都有部署这些安全措施,它表示这些措施会阻止这种行为,因为这些评估旨在测量基础模型的原始能力。重要的是,Anthropic 表示没有发现任何模型“追求自身目标”的证据,相反只是试图完成其被要求执行的任务。尽管这两起事件之间的比较无法避免,Anthropic 对其事件与 OpenAI 的事件进行了明确区分,指出 OpenAI 的模型利用一个未知的软件漏洞突破了测试环境,而 Anthropic 的模型则是通过一个错误地留下的开放路径到达互联网。OpenAI 还持续披露有关其自身违规的更多细节,表示其模型在四个服务的四个帐户上也使用了公开暴露的凭证:一个用于暂存,一个用于存储,两个只有被查看,而不是继续进一步入侵,根据 OpenAI 对此事件的更新博客内容。Anthropic 还通过指出它是自己通过主动审查发现事件,从而与 OpenAI 区分开来。同时,能够联系的两个受影响组织之前没有检测到活动或将其标记给 Anthropic。该公司补充说,它现在正在与独立评估小组 METR 合作,对这些事件进行第三方审查。OpenAI 意外突破 Hugging Face 的事件是人工智能实验室失去控制模型的第一个可验证案例,引发了产业和政界的一系列反应,其中许多人并不一定...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡