人工智能文本水印的工作原理
← declaude 一步一步、温和而直观地演示统计标记如何隐藏在生成的文本中,以及什么会将其抹去。在普通文本中加入水印听起来不可能。文本没有像素来隐藏数据,也没有元数据能在复制和粘贴中幸存;每个字符都明摆在你面前。标记可能藏在哪里呢?然而,这些标记是真实存在的。自2024年起,谷歌通过Gemini应用和网页体验对文本进行了水印处理(在撰写时,其API是一个经文档记录的例外),而截至2026年8月,新的Claude模型在模型级别上对文本进行了标记,早期模型也随之被引入。它们是隐形的,它们能在复制中存活,并且它们之所以有效,是因为它们根本不存在于字符中。它们存在于字符之间的选择中。五个简短的步骤,每个步骤都有需要关注的要点。没有比计数更难的。写作是一系列小选择。一个秘密钥匙依赖于这些选择。持有钥匙的人可以计数。编辑对标记的影响。实践中这意味着什么。1. 写作是一系列小选择。这一步的唯一理念:一个模型通过在多个可选单词之间掷加权骰子来写作,这些单词都是可以的。当模型处于句子的中间时,它并不知道“下一个词”。它有一个候选名单,就像自动补全一样,并有偏好。这是一个真实的时刻,在句子结束之前的一个词:正在写的句子。该研究的结果是相当的。每一次掷骰都扫荡候选名单,落在一个词上(概率匹配条形图),然后把它放入上面的句子。点数展示了骰子落在哪里:尝试×20,观察堆积的形状符合概率。注意什么始终不变:每一次落点都形成了一个完全合格的句子。一页文本包含数百个这样的分叉,每个词都有一个分叉,其中许多都可以是相同的。那个冗余是原材料。谁能掌控骰子落点的方式,就可以在文本中隐藏模式而不改变其内容。2. 一个秘密钥匙依赖于这些选择。这一步的唯一理念:钥匙悄悄为候选名单着色,并给一种颜色轻轻的推动。文本仍然读起来很正常。这是经典的配方(Kirchenbauer 2023;谷歌的SynthID通过更微妙的比赛风格达到同样的目的)。在每个分叉处,秘密键数学将候选单词分为绿色和红色,这种任意着色只有钥匙持有者能重现。然后骰子朝绿色倾斜一点。正在写的句子。该研究的结果是相当的。没有应用密钥:这些都是模型自身的偏好。虚线轮廓会在密钥启用后显示旧的概率。让这变得狡诈的有两点。推动是温和的:一个红色的词仍然可以胜出,只是可能性稍微低一些。而且,这种着色不是单词的固定属性:密钥从前面的短语中计算它,所以同一个候选词在一个前缀之后是绿色的,而在另一个前缀之后是红色的:相同的四个候选词,在六个不同前缀后由密钥着色。密钥看到它之前的单词;日历位置对它是不可见的。只有朝向绿色的整体倾斜累积,只有密钥持有者知道哪些单词在何处是绿色的。(两个兄弟,同样的原理。谷歌的SynthID(生产中的一种)用一个小秘密比赛替代推力:从模型自己的概率中提取一些候选者,密钥对它们评分,并排列比赛这样,平均过密钥的抽取,每个单词的概率保持完全符合模型的预期。Aaronson在OpenAI建立的计划甚至省略了这一点,并直接从密钥推导骰子的掷出。不同的数学,同样的原理:标记存在于选择中。)3. 持有密钥的人可以计数。这一步的唯一理念:有了密钥,你可以重新着色任何文本并简单计数。标记文本出现绿色的次数太多,不能只是运气。检测不会读取文本或判断其风格。检测器重新回放密钥持有者对单词的着色,并统计有多少单词变成了绿色。没有标记(或没有正确的密钥),绿色大约应该获胜一半的时间。就是抛硬币。这里有一个看起来普通的段落;试试两把钥匙:绿色:- 55 硬币翻转 标记栏(这么长)。填充和下划线的筹码是绿色的,虚线轮廓是红色的。无论哪种方式,单词读起来都相同;着色仅存在于密钥持有者的计算中。使用错误的密钥,分裂是无意义的,而计数处于随机状态。注意条形的要求。这一段显著倾斜,依然太短无法标记。检测器经过调谐,以至于误报几乎为零;代价是短的、编辑过的或轻微标记的文本往往被遗漏,而55个微弱倾斜的单词不够证据。点击继续阅读:倾斜保持完全不变,而条形向下滑动以满足越来越多的证据。长度也是测试的一部分。(而且这个演示的倾斜描绘得很强,以便你可以看到;一个生产标记的倾斜要温和得多,并需要相应多的文本。在这个演示的50/50模型中,一个1500字的文档
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡