事件概述

OpenAI 发布文章《Our approach to EU text provenance rules》,说明其在欧盟《人工智能法案》(EU AI Act)要求下对文本水印与内容溯源的阶段性落地方案。

原文给出的核心事实是:EU AI Act 要求生成式 AI 提供方以机器可读的方式让生成文本可被识别。OpenAI 认为文本水印与检测仍属于早期技术,存在明显局限,因此采取分阶段推进的方式,并强调要清楚说明「水印能说明什么、不能说明什么」。

具体动作包括三项:

  1. API 客户可选开启:即日起,全球 API 客户可以针对部分模型选择开启文本水印;原文明确说明,在 API 中文本水印默认关闭。
  2. 欧盟 ChatGPT 与 Codex 默认加水印:在未来几周内,OpenAI 将为欧盟地区符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印。
  3. 检测器仅向研究者开放申请:文本水印检测器的访问初期只限获批的研究人员和专家组织,用于帮助评估和改进该技术。

同时原文强调,这套安排只适用于文本溯源。图像与音频的验证工具(openai.com/verify 网页工具与 Content Provenance API)继续面向希望判断图像或音频是否由 OpenAI 系统生成的机构公开可用。

关键技术点

textGrain:在词选择中嵌入不可见统计信号

OpenAI 的文本水印技术名为 textGrain。其机制是:在模型的词语选择中加入一个不可见的统计信号,检测器则通过寻找该信号来判断一段文本是否包含 OpenAI 水印。

原文提到,关于 textGrain 工作原理的更多细节可在其技术报告中找到,该报告将在未来几周内补充更多内容;OpenAI 还计划将该技术开源,以便他人在其基础上继续构建。

在 OpenAI 自身的评测中,textGrain 的表现达到或超过了其测试过的其他方案,包括用于文本的 SynthID。但原文同时强调:理想条件下的强表现,并不保证在日常使用中也能可靠检测。

检测的两类错误与实测局限

原文指出检测器会出现两类错误:

  • 假阳性:本没有水印,却报告存在水印;
  • 假阴性:本存在水印,却未能检出。

在 1% 目标假阳性率下,OpenAI 给出的评估结果包括:

  • 文本长度影响检出率:约 200 token 的段落检出率约 80%,而约 400 token 的段落约 95%(以心理学等内容为例)。
  • 用词自由度影响检出率:对于数学这类用词灵活性较低的内容,检出率显著更低。原文未给出数学内容的具体检出数值。
  • 编辑会削弱水印:在 400 token 段落的评估中,用同义词替换 10% 的词语,检出率从约 92% 降至 66%;替换 25% 的词语,检出率降至 17%。

这些局限正是 OpenAI 决定初期只向获批研究人员和专家组织开放检测器访问的原因。

对输出质量的影响:基准测试数据

原文称,在用于评估其最新前沿模型 Astra 的基准上,加水印与不加水印未见有意义的性能差异。原文给出的数据如下:

基准 无水印文本(Astra, max) 有水印文本(Astra, max)
Artificial Analysis Intelligence Index 49.57 分 49.76 分
AutomationBench 34.09% 34.86%
DeepSWE v1.1 72.80% 71.68%
Terminal-Bench 4.0 53.90% 56.06%
Terminal-Bench Science 0.1 56.90% 60.00%
BrowseComp 87.92% 87.35%
HealthBench Professional 64.27% 64.60%
GPQA Diamond 94.44% 93.94%

水印的边界:它不能说明什么

原文用一整节明确划定了文本水印的信号边界,这部分对落地场景尤其重要:

  • 不衡量人类贡献:可表明 OpenAI 系统生成或处理了段落的一部分,但无法说明其中包含多少人类判断、编辑或创意。
  • 不确立所有权或责任:不决定文本归属、使用是否合法、是否需要披露、由谁负责。
  • 不识别用户:不会把个人、组织、账号、提示词或对话与文本关联起来。
  • 不验证准确性:不能说明内容是否真实、是否误导、是否有害、语境是否恰当。
  • 未检出 ≠ 人类作者:用 OpenAI 工具生成的文本可能因过短、被编辑或被翻译而无法可靠检测,也可能来自未支持水印的模型、早于水印上线时间,或由其他公司的工具生成。

分阶段推进与更广泛的内容溯源

原文列出的后续步骤与上述三项动作一致:在欧盟(仅欧盟)面向所有套餐的符合条件的 ChatGPT 和 Codex 用户推出文本水印,且不把文本水印作为发布时的全球默认设置;API 客户可选开启,并计划在未来几周与云合作伙伴协作,使其服务中访问的 OpenAI 模型输出也支持水印;检测器自发布之日起接受研究者与专家组织申请,依据 Code of Practice 初期按个案批准,工具只报告是否检测到 OpenAI 水印,不识别用户,也不披露其提示词或对话,且因为存在漏检与假阳性风险,发布时不面向公众开放。OpenAI 表示,随着技术、标准和证据演进,将重新审视该方案的每一部分。

在更广泛的内容溯源层面,原文称没有单一溯源技术足够,因此采取分层方法,结合开放标准、持久水印与验证工具:对支持的图像输出添加 Content Credentials,符合 C2PA 规范,在支持的图像和音频中嵌入不可见的 SynthID 水印,并通过 openai.com/verify 和 Content Provenance API 提供图像与音频验证。原文说明这些技术互补——Content Credentials 可记录文件来源与历史,而不可见水印可在元数据……(原文此处内容被截断,后续说明未完整给出)。

对数据科学与 AI Agent 落地的意义

第一,合规正在变成工程参数,而不是法务附件。EU AI Act 要求机器可读的标识,意味着生成式系统需要在水印开关、区域策略、模型支持范围上做出可配置的设计。API 默认关闭、欧盟默认开启、且只面向部分模型——这是一种典型的「按区域 + 按模型」的差异化配置,工程上需要相应的路由与版本管理能力。

第二,水印的鲁棒性边界直接对应数据处理流水线的行为。原文的实测数据说明,替换 10% 同义词就足以把检出率从 92% 拉到 66%,替换 25% 则跌到 17%。反过来看,任何做文本改写、同义替换、翻译、摘要压缩的数据增强或数据清洗流程,都会实质性地破坏文本水印信号。对于需要做 AI 生成内容审计或数据血缘追踪的场景,这意味着「检测不到水印」几乎不能作为「非 AI 生成」的证据——原文本身也明确写了这一点。

第三,对 AI Agent 而言,可追溯性的最小单位是「来源」而非「责任」。原文反复强调水印不识别用户、不确立责任、不验证准确性。因此 Agent 系统若想满足合规或审计需求,不能只依赖模型侧水印,还需要在自身链路中补充日志、来源记录和人工复核环节。水印能提供的是一个弱信号,而不是一个判定依据。

第四,检测器的访问门槛说明可靠性尚未达到可公开消费的程度。把访问限制在获批研究者与专家组织、并按个案审批,本质上是承认当前检测结果不足以支撑面向终端用户的自动判定。对企业的启示是:短期内不要在产品里构建「检测到水印即拒绝/处罚」这类硬性策略。

我的技术点评

这篇公告最值得肯定的地方,是它把技术的失效条件写在了和功能同等的篇幅里。80% / 95% 的长度差异、92% / 66% / 17% 的编辑衰减曲线、1% 的假阳性目标——这些数字比「我们支持水印了」有信息量得多。多数厂商在合规类公告里倾向于展示能力,而这份文档用一整节列出「水印不能告诉你什么」,对下游使用者的决策更有价值。

从技术选型看,textGrain 是在词的采样分布上做统计偏置,这与图像/音频里基于信号嵌入的 SynthID 属于不同量级的问题难度。文本的离散性、语义等价改写空间、以及长度对统计量的影响,决定了这类方法天然会面对「短文本 + 高约束内容」的双重困境。数学内容检出率显著偏低这一现象就很有代表性:当正确的下一个词几乎没有替代选项时,可供嵌入统计信号的自由度