一、概述

arXiv 上出现了一篇题为 《OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows》 的论文(arXiv:2609.09203,cs.AI,2026 年 9 月 5 日提交),作者为 Aayam Bansal 与 Keertan Balaji。该工作获得 ICML 2026 Workshop on AI for Science(”AI Scientists: Tools, Co-authors, or Founders?”)的 Best Dataset Award。

论文的出发点很直接:现有面向”自主 AI 科学家”的基准测试基本只评估最终产物——生成的代码、假设或论文——而把得到这些产物的推理过程丢弃了。这导致三个问题无法回答:科研方法论无法被审计、失败模式无法被诊断、系统性推理与”运气好猜对了”无法区分。

为此,作者发布了 OpenDiscoveryTrace:一个包含 558 条完整 AI 科研智能体轨迹的公开数据集,目标不是记录模型”产出什么”,而是记录模型”如何推理”。数据集、轨迹 schema、agent harness 与基准任务定义均以 CC BY 4.0 协议公开。

二、关键技术点

1. 每步 9 字段的结构化轨迹

每条轨迹记录为”每步 9 个字段”的结构化 trace。摘要中明确列出的字段类型包括:

  • thoughts(思考)
  • tool calls(工具调用)
  • observations(观察结果)
  • errors(错误)
  • revision triggers(修订触发条件)
  • self-reported confidence(模型自报置信度)

其余字段的具体名称,原文未说明。

2. 任务与领域覆盖

数据集覆盖 124 个科学任务,横跨四个方向:

  • 药物发现(drug discovery)
  • 材料科学(materials science)
  • 基因组学(genomics)
  • 科学文献分析(scientific literature analysis)

3. 模型覆盖

类型 模型 轨迹数
前沿模型 GPT-5.4 / Claude Opus 4.6 / Gemini 3.1 Pro 各 124 条,在领域与难度上完全均衡
开源权重模型 Qwen2.5-7B / Mistral-7B-v0.3 / Phi-3.5-mini / Qwen2.5-1.5B 各 30 条
实时检索变体 原文未说明具体模型 60 条

4. 试点分析:过程轨迹暴露了输出评测看不见的差异

作者对其中 363 条由 LLM 判定的轨迹做了试点分析,结论相当有信息量:

  • 三个前沿模型的成功率相当,都在 84%–89% 区间;
  • 但 Claude Opus 4.6 产生的错误数比 GPT-5.4 多 30 倍(每条轨迹 2.5 vs. 0.08,$p < 0.0001$,Cliff’s $\delta = 0.613$);
  • 更重要的是错误性质不同:Claude 的错误中 66.7% 属于工具误用,而 GPT-5.4 的错误中 83.6% 属于推理错误。

也就是说,仅看”最终对不对”,两个模型几乎无法区分;一旦看过程,二者几乎是两类完全不同的系统。

5. 五个基准任务与基线

论文定义了 5 个基准任务,并给出逻辑回归、随机森林、LSTM 与 Transformer 四类模型的基线结果。任务的具体定义与指标细节,原文摘要未说明。

三、对数据科学与 AI Agent 落地的意义

第一,”结果指标”正在成为 Agent 评测的天花板。 84%–89% 的成功率区间意味着,在输出层面的评测已经很难区分顶级模型。继续在这一层做排行榜,边际信息量极低。过程级 trace 提供了一个新的、可量化的分辨率。

第二,错误画像比错误率更能指导工程。 66.7% vs 83.6% 的差异不是”谁更好”,而是”该往哪里修”。工具误用占比高,说明问题更多出在工具接口设计、schema 约束、参数校验与 harness 实现上;推理错误占比高,则意味着需要加强中间验证、假设批判与自一致性检查。这两类问题的修复手段几乎不重叠。

第三,自报置信度与修订触发是 Agent 自我监控的原始信号。 数据集将 confidence 与 revision triggers 显式记录,为”什么时候应该让 Agent 停下来求助”提供了可训练、可评估的监督信号来源。

第四,对科学场景的合规与治理价值。 论文明确把该数据集定位为支持 process-level evaluation、scientific agent auditing 与 AI governance。在药物发现、基因组学这类容错率极低的领域,”结论正确但过程不可复现”是不可接受的,过程轨迹有望成为最低限度的审计材料。

第五,对数据科学工作流的迁移性。 虽然任务是科学任务,但 trace schema(思考—工具—观察—错误—修订—置信度)本身与数据分析 Agent 的执行结构高度同构,可直接作为建模过程日志的设计模板。不过要注意,任务与轨迹是否一一对应,原文未说明。

四、我的技术点评

这篇工作的真正贡献不在于”又一个数据集”,而在于它把评测的抽象层级向下移动了一层,并且用试点分析证明了这一层确实存在可测的方差。结论:输出层已饱和,过程层尚未开采。

几点值得注意的观察:

  1. 30 倍错误差 vs. 相当的成功率,是本文最有力的一张牌。 它说明”成功”这个标签本身高度粗糙。如果我们基于成功率做模型选型,很可能选到一个失败成本高得多(但恰好都被它兜住了)的系统。

  2. Cliff’s $\delta = 0.613$ 属于较大效应量,配合 $p < 0.0001$,统计上不算弱。但试点分析只覆盖 363 条轨迹、且依赖 LLM 判定,判定者本身的偏差未被摘要说明——这一点在实际复用结论时应保持谨慎。

  3. 开源权重模型每条只有 30 条轨迹,与前沿模型的 124 条不对等,跨模型类别的比较可能受样本量影响。原文未说明是否做了相应的加权或分层处理。

  4. “9 字段”这个说法在摘要中只展开了 6 类内容,剩下的字段是什么,需要读全文。对想做 trace schema 复用的人来说,这是最关键的部分。

  5. 125 个任务、558 条轨迹、7 个模型的规模在科研 Agent 数据集里不算大,更接近”高质量、可审计、可复现”的定位,而非规模竞赛。配上 CC BY 4.0 的开放协议,它的价值更可能体现在被当作评测协议的事实标准而非训练语料。

  6. 一个尚未回答的问题:过程轨迹能否预测最终成败?作者定义了 5 个基准任务,从逻辑回归到 Transformer 的基线设计暗示这正是他们想验证的方向。如果轨迹特征能在任务中途就给出高精度的失败预警,那才真正把过程评测从”审计工具”变成”在线控制信号”。这部分结果需要看全文。

五、原文链接