理解LLM水印对AI代理行为的影响
最近,Anthropic宣布未来的Claude模型将在其输出中嵌入隐形水印[1],[2],并随后披露该水印基于Google DeepMind的SynthID-Text[2],[3]。文本水印本身并不新鲜,但其部署现在具有监管相关性。欧盟人工智能法案第50(2)条[4]要求生成合成文本的AI系统提供者以机器可读的格式标记他们的输出,并使其能够被检测为人工生成或被操控,使用在技术上可行的范围内有效、可互操作、稳健和可靠的技术解决方案。水印的设计旨在追踪来源,但SynthID-Text改变了模型生成每个下一个令牌的过程。在模型层面,这可能改变安全行为,包括模型是否拒绝有害请求,以及这种拒绝在提示注入下是否依然有效。在代理层面,已采样的令牌可以决定调用哪个工具以及传递给它的参数。提示注入将这两个设置联系在一起,因为当模型可以通过工具进行操作时,减弱的拒绝变得更加重要。因此,这种水印过程可以影响模型所说的内容和代理所执行的行为。我们称这种行为效应为采样漂移。该漂移是否在实践中出现是一个经验问题。我们发现它在模型拒绝行为和代理工具调用中都存在。这种影响与模型和密钥有关,并且当相反方向的变化相互抵消时,聚合得分可能会掩盖这种影响。因此,我们报告水印和未水印运行之间的净性能和配对差异。此外,最后一部分讨论了这对AI安全和安全性意味着什么以及开发者应该如何应对。构建于内容来源,部署在代理内部。文本水印嵌入一个信号,允许输出被识别为AI生成。现有的方法包括后处理方法和直接集成到LLM生成中的方法[8]。生成时的处理方法包括logits偏置方法[5]、无失真密钥采样[6]、加密动机构造[7]以及SynthID-Text的比赛采样[3]。图1对比了这一过程与普通采样。我们使用SynthID的无失真配置,它在水印随机性上期望保留原始令牌分布,而在固定密钥下的单个生成仍然可以不同[3]。Dathathri等人报告近两千万次Gemini响应没有测得质量下降[3]。图1. 标准与水印文本生成。普通生成样本来自模型的令牌分布。生成水印增加了随机种子生成器、采样算法和评分函数;SynthID-Text使用比赛采样。从Dathathri等人[3]适配。Anthropic的部署还展示了为什么这不仅在第一方聊天界面上具有重要性。该公司表示,水印在模型层面应用,并覆盖通过Claude Platform API以及云提供商访问的受支持模型[1]。因此,使用水印模型作为代理的推理组件的开发者,即使代理本身是一个单独的应用程序,也可以接收水印输出。这使得水印的模型级行为效应与围绕这些模型构建的代理相关。水印偏向的相同令牌,代理也基于这些令牌进行操作。比赛采样在模型不确定时更有可能改变令牌选择。在结构化输出如JSON中,花括号、键和函数名称通常是高度可预测的,而值如查询、数字、路径和接收者则不然。因此,在普通散文中相当于词汇变化的改动可以改变代理执行的参数。权重和提示保持不变,但令牌选择并不会。重要的是,无失真不意味着在固定水印密钥下的行为相同。该保证适用于水印随机性,而特定密钥在生成期间改变令牌选择[3]。因此,产生的采样漂移可以改变代理行为,即使水印在Dathathri等人的定义下是无失真的。它的效果也可能依赖于水印密钥,因此我们测试多个密钥,而不是依赖于一个关键。我们如何衡量效果。我们使用配对设计进行两个实验。工具调用在BFCL v4单回合AST [9]上进行评估,而拒绝在200个HarmBench有害行为[10]和100个良性JailbreakBench控制[11]上进行评估,有害请求在裸请求和一种固定提示注入技术下进行测试。表1总结了数据集、评估范围、温度和预期行为。我们使用无失真的SynthID-Text配置,通过HuggingFace的未修改SynthIDTextWatermarkLogitsPro
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡