返回

文章详情

文本 AI 水印将始终容易去除

Hacker News2026年8月13日 15:07

欧盟 AI 法案将于 2026 年 8 月开始实施,从现在起还有一个月时间1。最大的新要求之一是第 50 条,要求所有 AI 输出被 "可检测为人工生成"。换句话说,如果大型语言模型提供商想要在欧盟开展业务,他们必须对其输出应用水印2:某种可以用于识别 AI 内容的隐藏签名。大型语言模型文本水印是一个引人入胜的问题。就像最好的工程问题一样,它在理论上难以完美解决,但有多种部分解决方案:例如,谷歌的 SynthID,以及(我将论证的)OpenAI 和 Anthropic 的一些隐蔽 Unicode 伎俩。看到 AI 实验室在年底之前如何应对这些权衡将是非常有趣的。为什么文本水印很难我在去年年底写过有关 AI 水印的内容,标题为《AI 检测工具无法证明文本是AI生成的》。给图像加水印很简单,因为数字图像包含许多人的眼睛看不见的噪声。例如,您可以应用一个水印,比如 "这二十个像素在这些确切的位置将始终共享一种颜色"。文本要难得多得多。与图像不同,文本是一种非常压缩的媒介:您不能对一个句子做出任何人类不会注意到的更改(有一个例外,我们稍后会讨论)。那么,您应该如何给它加水印呢?这基本上是一个文本隐写问题(隐藏秘密代码),因为明文不能被任意操纵。您对水印所做的任何更改都将影响输出的质量。例如,"每第五个字母是 'e'"将是一个不错的水印,但如果天真地应用,将使 AI 输出充满错误。您能否让模型找出如何适应水印?强大的 AI 模型足够聪明,可以处理这种约束3,但这仍然会消耗反而可以更好地用在用户问题上的推理时间,并使模型听起来远没有它实际的能力4。我们真的需要水印来检测 AI 内容吗?您真的需要水印吗?如果您是 Anthropic,并且被要求能够验证您的模型是否生成了特定文本块,您能否简单地将文本通过每个模型运行,边运行边测量模型预测的标记与文本中每个标记的匹配程度?不,事实并非如此。“所有可能的 Claude Sonnet 对一个问题的回答”的空间要远大于“所有可能的水印答案”的空间。换句话说,您会得到太多对人类文本的假阳性,它读起来像是 AI 写的。人类偶然写得像 Claude 的概率远高于人类偶然重现水印的概率。为每个文本片段运行每个 Anthropic 模型以加水印也将是不可承受的费用。欧盟 AI 法案最终将要求像 Anthropic 这样的实验室为每位欧盟公民提供免费水印服务(见承诺 2)。您无法通过“运行模型”方法做到这一点。SynthID 的工作原理据我所知,唯一声称能够为文本输出加水印的 AI 提供商是谷歌,他们使用一个叫做 SynthID 的工具。它的工作原理如下:当一个大型语言模型生成文本时,它实际上生成了一系列标记(单词或单词块)。在每一步,模型本身不会输出一个单一的标记,而是输出其词汇表中的所有(例如) 100,000 个标记的完整列表,每个标记都附有其成为下一个标记的概率。像 ChatGPT 或 Claude Code 这样的工具会从最可能的选项中随机选择,以获得它们的输出。这个半随机采样过程可以以一种可检测的方式受到影响。例如,我们可以选择一种采样策略,比如“我们选择第二个最可能的标记,然后是第一个,然后是第二个,然后是第一个,依此类推”。这仍然会产生高质量的输出,但您将能够重新运行模型以验证生成的文本中保持该模式。然而,这将使验证非常昂贵,且对输出的任何微小调整都会破坏该模式,从而破坏指纹。有更好的方法吗?是的。SynthID 是一种根据先前标记为每个标记分配一个“分数”的过程(例如,将标记的 ID 与其前三个标记的 ID 相加,然后取模 5)5。要应用水印,模型采用一种采样策略,比如“在前五个最可能的标记中,选择具有最高 SynthID 分数的标记”6。然后,可以通过计算一段文本的聚合 SynthID 分数来检测水印。如果它异常高,很可能是由 AI 生成的。这基本上是识别 LLM 的常见建议的一个版本,即使用破折号 ,不同之处在于它依赖于人类无法识别的单词之间的微妙数学关系,因为分配分数的过程很简单,

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡