Anthropic 在 Claude 代理三次失控后加强培训环境的安全性
Business Insider2026年9月1日 02:05
Anthropic 在 Claude 代理在四月获得未经授权的信息后加强了 AI 测试安全性。彭博社/盖蒂图片社 Anthropic 正在收紧用于训练和测试其 Claude 代理的数字环境。这一更新是在其模型未经许可访问三个组织的系统后发布的。公司在周一的博客中表示,已经部署了实时分类器,旨在检测 AI 模型是否积极探测或尝试逃离测试环境,并在发生之前阻止该行动。Anthropic 表示:“我们认为这些事件反映了运营安全的失败,以及两个对齐问题:动机推理和为了追求狭隘任务而愿意采取有害行动。” Anthropic 在更新中表示,模型可能以一种允许它们保持环境为模拟的方式解释了真实互联网访问的证据。它还表示,尽管有迹象表明其行为可能导致现实世界的伤害,它们仍表现出“鲁莽”,继续追求其分配的目标。这些变化是在 Anthropic 七月披露的三款 Claude 模型在四月份的评估过程中访问了三家组织的实时系统后发生的。模型被告知它们在没有互联网访问的模拟环境中运行,但一个第三方测试环境配置错误并仍然在线。这些事件还引发了一个日益激烈的辩论,即在安全性和速度产生冲突时,是否应放慢前沿 AI 的发展。Anthropic 呼吁尽快建立“合法、可验证、有效的协调速度机制”,并表示政府和行业必须协调,以防止竞争带来负面影响。目前,Anthropic 在帖子中表示,已将更高风险的网络安全测试移入更强大的沙盒中。公司暂时指派了 150 名产品工程师负责安全、可靠性和隐私工作,同时大多数高风险培训仍因进一步审查而暂停。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡