返回

文章详情

人类公司表示Claude在网络安全测试中黑客攻击了真实系统

Wired2026年7月31日 01:24

人类公司周四披露,其AI模型在网络安全测试期间未经授权访问了三个不同未公开组织的系统。公司表示,Claude在“与第三方评估环境互动时或从内部”访问了互联网。这一公告是在OpenAI透露其一款AI代理在一次独立的网络安全测试中黑客攻击了Hugging Face后发布的,距离该事件已有一周多。根据人类公司周四发布的一篇博客,该公司在OpenAI事件后决定对自己的网络安全评估进行“大规模回顾”。AI实验室表示,它最初识别出141,006个测试,认为Claude可能获得了互联网访问权限。然后它发现三种不同的Claude模型在第三方AI测试公司Irregular进行的评估中访问了互联网,并入侵了三家不同组织的生产基础设施。人类公司表示,这些事件涉及Opus 4.7、Mythos 5和一个内部研究测试模型。最早的事件发生在4月,这意味着它们可能在公众面前未被注意了数月。就像在OpenAI的案例中一样,人类公司故意关闭了旨在限制AI模型并防止其被滥用的安全保护。换句话说,这些并不是发布给公众的版本。人类公司在其博客中表示:“在所有三个事件中,Claude的任务是进行一次夺旗挑战,这是我们评估模型网络能力的方式之一。”公司补充说,在所有情况下,“人类公司的评估提示明确告知Claude其环境是模拟环境,并且没有互联网访问权限。”它将这一疏忽归因于人类公司与Irregular之间的“一次误解”。尽管Claude不应该拥有互联网访问权限,但人类公司表示,Irregular错误配置了用于测试Claude的机器,使得AI模型能够浏览网络。人类公司在博客中表示:“在上周通过我们的额外评估监控检测到此错误配置之前,我们和我们的评估合作伙伴均未意识到这一点。”Hunter Strategy研究与开发副总裁Jake Williams表示:“我们现在有证据表明,两个最大的AI实验室不仅未能控制其代理,还未能实时检测到它们的越狱行为。”“显然,AI测试需要立即进行监管和政府监督。”Irregular和人类公司未立即回应评论请求。与OpenAI案例不同,人类公司表示Claude没有发现或利用任何复杂的漏洞。相反,它依赖于基本技术,“例如利用弱密码和未经身份验证的端点。”OpenAI表示,其AI代理通过利用零日漏洞访问了互联网。但接着,它使用与人类模型相同的一系列日常网络安全弱点,访问了多个第三方组织的系统。具体而言,OpenAI表示,这款AI代理显然找到了在公开互联网中暴露的凭据。人类公司承认,如果该AI实验室及其测试合作伙伴实施更多“深度防御”措施,他们本可以避免这些事件,或至少减少发生的可能性,这与OpenAI对日益增加的批评的回应相呼应。“我不明白这些AI实验室为何会把这一切当作‘只是发生的事情’,”Williams说。“这不是。这是疏忽。”AI实验室强调,模型被告知它们没有访问公开互联网的权限,大部分情况下,Claude将它所访问的组织误认为是测试环境的一部分。换句话说,这些模型在很大程度上并没有意识到自己已经突破了限制。但在某些情况下,AI模型知道出现了问题,并正确检测到它们所访问的基础设施是真实的。最古老的模型Opus 4.7被指派针对一家与真实网站域名同名的虚构公司。在模拟环境中无法完成任务后,它转而袭击真实公司,成功窃取凭据并访问生产数据库。人类公司表示,在某个时点,它了解到自己“很可能在真实环境中操作”,但仍然坚持攻击。人类公司发布的最强大模型Mythos 5也意识到它处于现实世界中,但它“推理回到结论,认为自己仍在模拟中。”人类公司表示,其认为是最强大的内部测试模型,一旦发现其目标是真实的,就停止了攻击。人类公司和OpenAI表示,他们已聘请METR,另一个第三方AI评估机构,对各自的工作进行独立审查。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡