事件概述

2026 年 8 月,Anthropic 宣布将在全球所有 Claude 模型中引入“水印”机制,用以标记 AI 生成内容(包括文本),以符合欧盟相关法规。然而,Daring Fireball 的 John Gruber 撰文批评这一做法,认为它是对写作的亵渎。Anthropic 最初的支持文档声称水印是“不可察觉的”,不会改变文本的含义、质量或可读性,但后续说明揭示了真相:他们实际上会通过选择特定的词语(token)来嵌入概率性指纹,这不可避免会改变文本的语义。

关键技术点

Gruber 在文章中解释了文本水印的工作原理:

  • 这是一种隐写术,在推理时,模型在生成每个 token 时会有意偏向“绿色”词列表中的词,而避免“红色”列表中的词。
  • 绿色/红色列表是动态生成的,使用秘密密钥,因此外部无法预测或伪造。
  • 检测时,通过统计文本中绿色词和红色词的比例,判断是否由特定模型生成。文本越长,置信度越高。
  • 只有 Anthropic 持有密钥,所以只能检测自家的水印,其他模型不可互检。

Gruber 还提到了 James Padolsey 的交互式文章《How AI Text Watermarking Works》,认为这篇作品清晰展示了上述概念,并以“抛硬币”类比解释:如果硬币有偏向,抛的次数越多,越容易判断它是公平还是偏向一边。同理,文本越长,水印检测的置信度越高;反之,短文本几乎无法判断是否带有水印。

对数据科学或 AI Agent 落地的意义

文本水印技术看似为 AI 内容溯源提供了一种技术方案,但 Gruber 指出,没有任何两个同义词承载完全相同的含义。强制偏好在每次决策中牺牲了最精确的词语选择,从而损害了文本质量。对于依赖 AI 生成高质量内容的写作任务、以及以精确表达为核心的数据科学报告,这种损害是不可接受的。对于 AI Agent 而言,如果其输出被水印影响,可能会导致语义偏差,进而影响下游决策。

我的技术点评

我认为 Gruber 的批评切中要害。Anthropic 最初承诺“不改变含义”与实际技术实现是矛盾的。虽然语义水印比不可见字符更隐蔽,但“有偏”的词语选择本质上是对生成分布的干扰。如果这种干扰是随机的且幅度很小,或许可以接受,但 Anthropic 未提供任何量化保证。更关键的是,这种水印只对总长度足够的长文本有效,短文本无法检测,这限制了其实际用途。此外,将内容溯源责任全部推给用户,而牺牲生成质量,是短视的设计。希望后续看到 Anthropic 公布更多细节,包括对文本质量的定量影响,以及是否允许用户主动关闭该机制(原文未说明)。

原文链接