事件/论文概述

2026年7月16日,arXiv上发布了一篇题为《OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets》的论文(arXiv:2607.13037)。该研究由Haolin Xue独立完成,针对AI模型训练中数据溯源与遗忘机制之间的实际缺口提出解决方案。当前,当数据贡献者请求删除其数据时,模型训练者需要一个精确的“遗忘集”,但缺乏能够定位特定作者训练记录的工具。现有的溯源系统仅在文件或数据集级别运作,导致灾难性的过度删除。OriginBlame(简称ob)系统通过记录级和Token级的数据溯源,将作者身份信息沿数据处理流程传播,并通过确定性查询将撤销请求解析为精确的遗忘集。

关键技术点

  1. 记录级与Token级溯源:区别于传统的文件/数据集级溯源,OriginBlame能够精确到每条训练记录乃至每个Token的归属,实现细粒度溯源。
  2. 作者身份传播:系统设计了一种机制,可在数据预处理、清洗、转换等流水线中保持作者身份信息的传播,不因数据变形而丢失。
  3. 确定性遗忘集解析:针对数据贡献者的撤回请求,通过确定性查询(而非概率性方法)准确定位需要遗忘的训练数据,从而与各类遗忘算法对接。
  4. 实验验证:在219,555个Wikipedia页面上进行评测,记录级溯源将数据集级过度删除从101倍降至1.3倍;集成到HuggingFace和Datatrove后,吞吐量开销分别为1.3-4.0%和2.1-19.0%(基于wiki数据)。在1.7B参数的模型上,基于溯源生成的遗忘集比随机基线提升42%的遗忘效果。

对数据科学或AI Agent落地的意义

数据溯源是AI合规与隐私保护的核心技术之一。OriginBlame将溯源粒度从粗粒度的数据集/文件推进到记录乃至Token级别,对以下场景具有重要价值:

  • 数据遗忘(Machine Unlearning):精准的遗忘集生成可极大降低遗忘算法的误删率,提升合规效率。
  • 数据版权与贡献者管理:在AI Agent训练中,常使用来自不同来源的混合数据,OriginBlame可清晰追溯每条数据的贡献者,便于后续授权核查或删除请求处理。
  • 模型审计与透明度:细粒度溯源为模型行为归因(如特定生成来自哪些训练Token)提供了可能,增强AI系统的可解释性和可信度。

我的技术点评

OriginBlame的设计思路非常符合当前AI治理的现实需求:一方面,数据隐私法规(如GDPR的“被遗忘权”)要求模型能够删除特定用户的数据;另一方面,大规模训练数据往往经过复杂流水线处理,简单的文件级标记极易导致过度或不足删除。该工作通过将溯源深入到Token级别,并引入确定性查询,在精度和性能之间取得了不错的平衡。不过,论文的评估仅在Wikipedia数据上进行,且数据规模相对有限(约22万页面),其在不同领域、更大规模数据集以及真实世界复杂流水线中的表现仍需进一步验证。此外,在1.7B模型上提升42%虽然显著,但相对于完美遗忘的理论上限,仍有较大差距。未来若能将溯源与遗忘算法深度耦合(而非仅提供遗忘集),或许能取得更优效果。总体而言,这是一项方向正确、工程实现扎实的研究,有望推动数据溯源与模型遗忘的实用化进程。

原文链接

OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets