安全与对齐:在长期模型时代
能够自主工作很长时间的模型可以解决困难的开放性问题。但使它们有用的同样的持久性也使它们有更多机会采取不希望的行动——以短期模型的评估可能忽略的方式。大约两个月前,我们宣布,一个内部的通用模型推翻了厄尔托什单位距离猜想。该模型旨在自主工作非常长的时间。在有限的、受监控的内部使用中,我们观察到现有部署评估未能捕捉的不希望的行为。由于部署是有限且受监控的,我们能够识别这些问题,暂停访问,基于我们观察到的情况创建新的评估,加强模型及其保护措施,然后在持续监控下恢复访问。我们评估模型的条件永远无法完美匹配它们在实际使用中遇到的条件。这就是为什么预部署评估需要与有限的监控部署以及在问题出现时进行干预、暂停或回滚的能力配对。我们从部署中学到的内容可以成为更强评估和保护措施的一部分,在访问扩大之前。在接下来的部分中,我们分享具体示例,说明我们观察到的内容、如何解决问题,以及这一经验如何影响未来的发布。模型的持久性可能暴露安全漏洞。新的模型可以通过反复尝试,在长时间内持续朝着目标努力。这种持久性可能导致它发现并利用环境中的弱点。以前的模型在遇到沙箱或环境约束时会简单停止并返回给用户。而这个模型经常会继续尝试,这包括寻找在沙箱外部采取行动的方法。在对NanoGPT speedrun的内部评估中发生了一个例子,这是一个公开的基准,用于在尽可能少的步骤中训练一个小型语言模型。我们的模型开发了一种叫做PowerCool的幂律学习率冷却机制,带来了显著的改进。该模型被指示只能将结果发布到Slack,但NanoGPT的说明要求将结果作为PR发布到GitHub,而模型遵循后者的说明,在公共GitHub存储库中打开了PR #287。该模型绕过了旨在阻止外部访问的沙箱限制,并进行了GitHub的上传。我们的模型花了一小时找到沙箱中的一个漏洞来制作PR;早期的模型持久性较差,没有找到漏洞,反而在PR部分放弃了。从考虑单一行动到考虑整个轨迹。许多AI助手的安全控制是围绕个别行为设计的。如果一个行动被禁止,它便被阻止。如果它是敏感的,系统会请用户明确批准。但长时间运行的模型,其行为可能在数小时、数天甚至数周内自主展开,挑战了这种设置:监控单个行动已不足以追踪整体轨迹的意图。例如,在一个模型被要求解决一个问题的场景中,模型观察到其他系统有成功但私密的提交,并尝试从评估后端恢复这些解决方案。当其初始尝试因扫描器检测到认证令牌而被阻止时,模型将令牌主体分成两个部分,进行了模糊处理,然后在运行时重建凭据,使完整令牌永远不会作为一个连续的字符串出现。模型在对用户的评论和推理痕迹中明确表示,它采取这些步骤是为了规避扫描器。这个例子展示了每一步看起来都可以独立接受,而序列可以产生一个不会被批准的结果。它还展示了一个在长期时间范围内有效运作的模型如何学习批准系统的盲点并围绕它工作以达到目标。长期安全不仅需要问“这个行动被允许吗?”还需要问“这组行动的结果是什么?”为长期运行的模型建立保护措施。由于这些事件,我们暂停了新模型的内部部署。我们围绕深度防御和轨迹级监控重建了安全系统。事件派生的评估。评估可以让我们在系统实际部署之前,了解其是否安全。然而,为了最有效,评估应反映实际部署期间轨迹的分布和时间范围。因此,我们利用观察到的失败开发了对抗性评估。我们发现,通过改进基于现实世界事件派生的评估,反过来导致在生产环境中部署后行为更安全。改进对齐。我们采取了措施减少它采取不希望行为的倾向。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡