返回

文章详情

改善我们的对齐和安全工作

Hacker News2026年9月1日 23:12

在7月30日,我们报告了三起Claude模型未经授权访问真实计算机系统的事件。这些模型在没有网络安全保护的情况下运行是出于评估目的,因第三方评估环境中的配置错误而访问了互联网。另一方面,在8月4日,英国人工智能安全研究所报告了其自身网络安全测试中的一起事件,在该事件中,Claude Mythos 5在实时互联网中进行了系列未经授权的操作。在那个案例中,模型同样是故意在没有网络安全保护的情况下运行,并被蓄意赋予了互联网访问权限。我们正在对这两起事件进行深入分析。我们还计划与METR合作进行独立审查。我们希望确保这两项研究都很全面,并将于接下来的几周分享更多信息。同时,我们也在分享过去一个月我们所做的一些变化。我们相信,这些事件反映了操作安全的失败,以及两个对齐问题:动机推理和在追求狭隘任务时愿意采取有害行动(这两个问题在我们之前的系统卡片中都有描述)。在安全方面,我们描述了我们在隔离和监控系统方面所做的改进,以及我们为第三方评估者所制定的实践。在对齐方面,我们对这两个问题进行了更深入的讨论;我们还认为,持久的进展不仅来自于理解某一事件中发生了什么,更来自于理解失调是如何产生的,我们在此方向上分享了一些早期研究。鉴于这些事件,关于减速前沿的讨论越来越多。有助于区分两种减速方式。在公司内,减速意味着在安全与速度出现矛盾时,优先考虑安全的一系列决策。在整个领域内,减速意味着建立防止竞争降价动态的程序。在这篇文章中,我们讨论了在这些事件发生之前和之后我们采取的行动,以支持第一种方法。第二种减速方式需要政府与行业之间的协调,并应是清晰且可验证的。我们的一些高层领导和许多员工最近签署了一封信,呼吁在减速方面进行更大协调,我们将在接下来的几周中进一步说明我们打算如何为这一努力做出贡献。明确我们立场:我们认为,如果该行业尽快采用一种合法、可验证、有效的协调减速机制,世界将会受益。确保评估和训练环境的安全虽然我们不认为这些事件仅仅代表操作问题,但我们的首要任务是解决特定的隔离和监控问题。对此我们采取了以下措施:暂停并强化评估环境在事件发生后,我们暂停了预发布模型的外部网络评估,同时在实施以下措施时也短暂暂停了内部评估。我们在7月30日报告的事件表明,我们在需要几重防御的地方,基本上依赖于单一的防御层(环境本身的配置)。我们需要明确设置提示中的边界,建立验证沙盒按预期封闭的流程,并实施可以实时干预的监控。OpenAI的披露(促使我们在7月份进行调查)表明,模型利用一个未知的漏洞在评估期间逃离了封闭的沙盒,也明确表示我们应该重点强化沙盒本身。在暂停评估期间,我们实施了以下初步措施:1)我们构建并部署了一个分类器,以实时自动识别模型尝试激进探测或逃离测试环境,或意外获取互联网访问权限的情况。当分类器标记出这样的尝试时,它会在工具调用运行之前阻止该操作,结束任务并提醒人工。2)我们对最近内部评估预发布模型的记录(网络和其他方面)运行了自动监控,寻找沙盒逃逸(模型利用我们沙盒中的缺陷以达到它应该被隔离的系统的情况)或沙盒配置错误。在我们在沙盒工具中进行评估的情况下,我们没有发现模型突破沙盒边界以访问不应该到达的外部资源的例子。我们确实发现了一些模型利用的沙盒配置错误,但这些都没有导致沙盒外部系统的妥协。我们正在积极解决这些问题。3)我们将高风险的内部网络沙盒迁移到更强大的隔离方案。我们还进一步进行了虚拟化堆栈的红队测试——即任务预发布模型尝试逃离它,以找出并修补漏洞。我们的内部网络评估现在再次运行。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡