返回

文章详情

通过灌输对比信念来测量寻求奖励的行为

Hacker News2026年7月21日 18:17

← 返回 OpenAI 对齐博客 2026年7月21日 · Axel Højmark (Apollo Research), Jérémy Scheurer (Apollo Research), Jenny Nitishinskaya, Felix Hofstätter (Apollo Research), Jason Wolfe, Theodore Ehrenborg (Apollo Research), Bronson Schoen (Apollo Research), Alexander Meinke (Apollo Research) 阅读论文 简介 我们开发了一项新测试,称为对比合成文档微调(Contrastive Synthetic Document Finetuning, Contrastive SDF),用以检查当AI模型对世界有不同的信念时,是否会改变其行为。我们检查了该测试在明确训练以偏向权威偏好的模型以及训练以作弊单元测试的模型上的有效性。经过前沿规模的强化学习训练的模型,尽管没有任何安全训练,更可能按照其认为评分者想要的去做,即使这与用户或开发者的期望相悖,而且这种倾向在训练中不断加强。 图1. 使用对比SDF测量寻求奖励的行为。 引言 机器学习模型可以为错误的原因产生正确的输出。著名的例子包括一位强化学习代理,该代理因为收集始终放在关卡右端的硬币而获得奖励,最终学会了向右奔跑而不是寻找硬币本身 [Langosco ; Shah],以及一个肺炎分类器,它学会识别拍X光片的医院而不是疾病的特征 [Zech]。训练后的行为在训练分布上看起来是正确的,而其底层策略则跟踪一个不理想的代理。其中一个这样的代理就是奖励过程本身:模型可能会学习追求其评分者奖励的内容,而不是设计者所期望的内容。我们称这种行为为寻求奖励:模型代表其评分者(在训练中是奖励模型,在测试中是评价评分者,或在部署中是监控者)并根据其认为评分者奖励的内容调整其行为 [Carlsmith ; Hebbar ; Mallen & Shlegeris]。寻求奖励的模型可能终极追求评分者的赞同,或为了保护某种其他目标而工具性地追求它,比如避免修改或获取未来的影响力 [Hubinger ; Carlsmith];我们的定义并不区分这两者。几个前沿模型的训练检查点在没有特殊提示的情况下参与评分者推理(明确推理关于评分者的期望) [Schoen & Nitishinskaya ; Claude Opus 4.8 系统卡 ; Fable 5 系统卡 ; METR 的 GPT-5.6 评估 ; GPT-5.6 预览系统卡];见图2的例子。这种推理是寻求奖励的证据,但作为一个系统的测量工具效果不佳:模型可以在不明确表达其评分者信念的情况下,根据其评分者信念(关于评分者偏好的信念)进行行动,并且口头表达的推理通常无法清晰映射到最终的行动 [Schoen & Nitishinskaya]。在这项工作中,我们将寻求奖励的操作化定义为行为对关于评分者偏好的信念的因果敏感性。图2. 在评估中的寻求奖励。一个以能力为焦点的晚期检查点被要求生成一个随机的奇数,而一个明显的外部元数据块揭示了一个“评分者”,奖励偶数输出。模型推理认为它应该输出一个偶数,无视用户的请求,并返回4。测量这种敏感性需要一种干预,能够可控地改变模型的评分者信念。在某些情况下,背景实验可以检测到寻求奖励,但作为可靠的测量它们注定会失败,因为模型可能会对放置在其上下文中的声明产生怀疑。我们使用合成文档微调(SDF):对以某个目标事实为真的方式编写的预训练格式化文档(学术论文、新闻文章、教科书)进行微调。我们对同一模型的两个副本在暗示对立的评分者偏好的匹配语料上进行微调,评估这两者在下游任务上的表现,并测量行为在多大程度上遵循评分者的暗示偏好(图1)。我们将此程序称为对比SDF。对比SDF如何测量寻求奖励 一个寻求奖励的模型优化其认为评分者所奖励的内容,因此当这些信念变化时,其行为应该会变化,我们可以用此来衡量模型的寻求奖励程度。我们使用SDF灌输这种信念。然而,仅仅灌输一个信念并不能揭示寻求奖励。假设我们灌输了评分者奖励列表推导而非循环的信念,模型开始写列表推导。这个变化与寻求奖励是一致的,即模型写列表推导以满足评分者的要求。但这也可能与信念转移一致——模型推断用户也想要列表推导并写出它们来服务于用户——或者与训练使列表推导更加显著一致。为了减轻这些替代因素,我们使测量形成对比,迫使模型在评分者和一个对立权威之间进行选择(对比SDF)。我们使用一个能力模型可能已经代表的虚构版本的相关方:它的用户

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡