返回

文章详情

Anthropic的隐形水印能否遏制‘AI垃圾’? 研究人员仍持怀疑态度

Nature2026年8月13日 00:00

人工智能公司Anthropic表示,其Claude模型将为人工智能生成的内容加上水印。图片来源: Samuel Boivin/NurPhoto via Getty。Anthropic是人工智能模型Claude的开发公司,宣布自2023年8月2日起,任何新发布模型生成的文本将隐形嵌入一个水印,表明该输出是由人工智能撰写的。同时,Claude生成的图像在多数情况下将附带元数据,包含数字签名以显示该模型处理了该文件。基于文本的水印使用一种算法调整人工智能模型选择措辞的方式。当应用于一段文本时,这一过程会在输出中留下统计上可观察的痕迹。总部位于加利福尼亚州旧金山的Anthropic表示,其水印不会改变Claude回答的“含义、质量或可读性”,而且“在某些编辑中可能仍然存在”。这一举措是为了响应2024年正式通过的欧盟人工智能法案。从今年8月2日起,前沿人工智能模型的提供者必须确保人工智能生成的输出能够被检测出来,否则将面临高达1500万欧元(约合1700万美元)或其全球年营业额的3%的罚款。在8月2日后发布的模型必须立即符合要求,而市场上已有的版本则有时间直到12月2日才能符合。Anthropic表示水印将在全球范围内应用于Claude的输出。水印的存在对于模型的使用揭示甚少。Anthropic表示,检测到水印“提供了一个信号”,表明内容是由Claude生成的,但并不能得出结论:例如,该模型可能仅被用来总结或翻译一个原始人类想法。同样,缺乏水印并不意味着该文本不是由人工智能生成的。由于水印是基于模型措辞选择的微妙变化模式,因此非常短的段落,或者经过改写或重新编写的文本,可能不再保留信号。“人性化”工具可以消除AI撰写文本的痕迹——这使得科学家感到不安。水印对学术诚信的影响仍不清楚。考虑到水印可以很容易地从文本中去除——例如,通过使用另一个模型——它们不太可能阻止那些有动机的人使用人工智能制作假冒或低质量论文,即所谓的AI垃圾,正如伊利诺伊州埃文斯顿的西北大学的元科学家Reese Richardson所言。但如果人工智能公司创建允许其他人检查水印的工具——正如Anthropic所声明的那样——如果这些工具的误报率在可接受的范围内,一些不合法使用人工智能的情况将可能被检测出来,宾夕法尼亚州匹兹堡的卡内基梅隆大学研究科学评估的计算机科学家Nihar Shah说。例如,水印可以帮助期刊编辑或会议组织者在同行评审中执行严格的“无AI”政策,正如2026年国际机器学习会议(ICML)在其两个可能的评审渠道中所做的那样。七月份的活动组织者在分发给同行评审的论文中增加了水印,当AI在评审报告中使用时会生成明显的文本。他们抓住了506名违反无AI政策的评审员。“这一经历表明,虽然一些不合法的AI使用可能试图避开检测,但许多人可能只是简单地复制粘贴AI输出。”负责ICML水印流程的Shah说。“隐形墨水”。在这些严格的框架之外,一些学者警告说,使用水印来判断大学的学术诚信是危险的。“我担心的是,如果它开始被视为作者身份的二元衡量标准:有水印等于AI撰写,没有水印等于人类撰写。”Amina Yonis表示。作为分子生物学家培训的Yonis现在运营着“页面医生”,一家帮助学生写作和编辑的公司,同时也提倡道德使用AI。故意尝试隐瞒人工智能使用的学生可能是最有可能逃避检测的人,她补充说。“这可能对透明性有用,但却不是确定学生是否作弊的可靠方式。”康奈尔大学物理学家Paul Ginsparg表示,在一个合法论文由人工智能撰写的世界中,水印的影响微乎其微,并且他是预印本存储库arXiv的创始人。在数学领域,人工智能已取得了一系列成功,许多人认为某些种类的声明会得到AI的辅助,他表示。“很少有人会费心去掩盖水印。”全球AI安全的资本正在兴起——而它不在硅谷。Anthropic并不是第一家引入水印的公司,如果要遵守欧盟人工智能法案,所有前沿模型最终都必须包含水印。谷歌自2023年以来在其模型Gemini的浏览器和应用版本生成的文本中使用了SynthID标记。OpenAI也采用了SynthID为......

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡