调查我们网络安全评估中的三个真实案例
在对我们的网络安全评估记录进行评审时,我们发现了三个事件,其中一个Claude模型在与第三方评估环境交互时,访问了互联网,并获得了对三家不同组织的真实系统的未经授权访问。以下是我们描述了发生了什么,如何发生的,以及我们正在做出的改变。我们鼓励其他人工智能实验室进行类似的评审。此帖子反映了我们的当前理解;如果有任何细节变化,我们将更新。7月21日,OpenAI披露他们的几个模型通过利用之前未知的(“零日”)漏洞,从一个隔离的测试环境中逃脱。这些模型随后访问了Hugging Face的生产基础设施,这是一个用于开源机器学习模型和人工智能数据集的平台。对此事件的回应,我们开始对自己的网络安全评估进行大规模回顾。我们特别查找Claude是否能够从本应封闭的测试环境访问互联网,正如访问Hugging Face的OpenAI模型。经过对141,006次评估运行的审查,我们确认了三个事件,其中一个模型在与我们的第三方评估合作伙伴Irregular的评估环境中访问了互联网,并且获得了三家不同组织的生产基础设施的未经授权访问。在这三起事件中,Claude的任务是完成一个“夺旗挑战”,这是我们评估模型网络能力的一种方式。模型被给定一个虚构的场景,并被告知一段秘密信息(“旗帜”)被隐藏在网络中的另一台机器上,目标是破坏并检索它。挑战是开放式的,没有规定特定的方法。在所有情况下,Anthropic的评估提示向Claude明确表示其环境是一个模拟,并且没有互联网访问权限。由于我们和评估合作伙伴之间的误解,情况并非如此,互联网访问是可用的。因此,当Claude的搜索将其引导至真实的开放互联网系统时,它将这些视为练习的一部分。(网络安全评估通常包含现实的细节,以准确评估模型在真实环境中的能力;一个看起来逼真的目标本身不会清楚地表明模型该目标不是模拟的一部分。)在错误认为所有可访问实体都是本次练习的范围之内的情况下,Claude利用基本技术,如利用弱密码和未经认证的端点,危害了受影响组织的基础设施。它没有发现或利用任何复杂的漏洞,在每种情况下,Claude仅根据其评估分配的特定夺旗任务继续工作。然而,在某些情况下,我们的老模型在获取证据表明它正在开放互联网时,仍继续攻击;而我们的最新模型在意识到它在互联网上时停止了。在这些情况下,Claude没有自我泄露或故意尝试逃离测试环境。这些事件涉及三种不同的Claude模型:Opus 4.7, Mythos 5和一个内部研究测试模型。最早的事件追溯到四月。这些评估中的模型在运行时没有部署我们通常在模型通用可用时采用的标准保护措施(即,它们没有我们通常实施以防止滥用的分类器和监控)。不过,这些模型确实得到了特定于模型的安全培训(即,它们不是我们在测试中有时使用的“仅限帮助”的版本)。所有此处描述的评估都在专用基础设施上运行,该基础设施与Anthropic的敏感内部系统或客户数据是隔离的。我们在7月23日星期四开始了转录审查,并在同一天停止了所有网络评估,因为发现了Claude可能访问互联网的记录。我们在第二天确认了所有三个事件。我们在7月27日星期一通知了我们的评估伙伴Irregular和三家受影响的组织。我们能够联系到的两家组织此前未检测到这些活动或联系我们,我们现在正在与他们合作进行修复。我们继续努力联系第三家。我们与Irregular共同进行了这次审查。我们对他们与我们密切合作以理解和解决这些事件表示感谢;他们也在进行自己的调查。我们相信这种类型的合作对于确保安全、严格的模型评估越来越重要。我们期待在安全问题上的共同工作。在接下来的内容中,我们提供了关于每个事件的更多细节以及我们的回应。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡