事件概述

随着 AI 技术在数学、医学、材料科学等领域持续帮助科学家取得突破,评估数据集的更新速度与质量面临着前所未有的挑战。2026 年 6 月,由 Kihwan Han 等 7 位研究者提交至 arXiv 的论文 Expert-validated STEM QA(编号 2608.28591)提出了一套全新的高质量、专家验证的 STEM 问答数据集。该数据集涵盖物理、化学、生物学和数学四个学科,共包含 398 个问题,由 241 位领域专家共同创建,并已经部分开源。

论文核心发现:前沿 AI 模型在该数据集上的准确率低于 25%,显示出明显的性能“天花板”;同时,使用该数据集的私有扩展版本(N=2,000)对开源模型进行后训练,使模型在 HLE-verified 数据集的 STEM 子集上相对性能提升了 15%(p=0.045),证明了该数据在模型训练上的潜在价值。

关键技术点

1. 现有 STEM 数据集的四大缺陷

研究人员指出,当前主流 STEM 评估数据集普遍存在以下问题:

  • 性能饱和:模型在既有数据集上已接近满分,导致评估“失去区分度”,无法为模型改进提供有效指导。
  • 分类体系分布不均:现有数据集的 taxonomy(分类学结构)存在明显偏斜,难以覆盖 STEM 各学科的真实知识分布。
  • 选择题格式脱离实际:真实世界中科学家使用 AI 的方式通常是开放式问答,而不是从 A/B/C/D 中做选择——这使得评估结果与实际应用场景严重脱节。
  • 答案与推理过程不可靠:部分既有数据集采用竞赛式收集和时间受限的评审流程,导致部分标准答案和模型推理有误,影响后续训练与评估的准确性。

2. 数据集构建方法:四条“纠偏”策略

针对上述问题,研究团队设计并实施了四项关键策略:

  • 精心平衡的分类体系:从设计源头保证 taxonomy 在各学科和子领域上的分布均衡,避免依赖网络爬取的偶然性。
  • 基于质量激励的贡献者筛选:对问题贡献者进行严格的资质审查和筛选,并通过质量驱动的激励机制确保题目与解答的专业性。
  • 多轮评审与共识验证:数据集经历了多轮评审,每一轮修订都交由领域专家进行共识验证,以最大程度减少错误答案和错误解释。
  • 可验证的问答格式:采用可验证的question-answer格式,而非选择题,以贴合科学家在真实工作流中使用 AI 的方式,同时便于事后溯责和人工复核。

3. 实验结果:从评估到训练的闭环

论文通过两组关键实验验证了数据集的价值:

  • 作为 Benchmark:在 398 道专家验证题目上,多个前沿 AI 模型(frontier models)的性能均低于 25%,说明该数据集对现有模型具有较高的难度和区分度。
  • 作为训练数据:研究团队使用一个单独的私有版本(N=2,000)对开源模型进行后训练(post-training),结果显示,在 HLE-verified 数据集的 STEM 子集上,模型相对性能提升 15%,且统计显著(p=0.045)。这表明该数据集不仅能用于评估,还能用于增强模型的 STEM 推理能力。

对数据科学和 AI Agent 落地的意义

1. 为 AI 评估提供“去饱和”基准

当前许多公开 benchmark 已被前沿模型“刷爆”。本文通过专家对抗式出题和多轮评审,构建了一个让前沿模型准确率低于 25% 的“高难度”评测集。对于数据科学家而言,这意味着一个真正有意义的新基准:它能为模型迭代提供更大的头部空间,也能更清晰地暴露模型在数学推理、物理直觉、化学知识方面的短板。

2. 推动 Agent 系统的“可验证”评测模式

论文明确反对“选择题式”评测,强调真实科学家与 AI 的交互方式是开放式问答。这对 AI Agent 落地有直接启示:

  • Agent 系统在科研场景中需要生成详细的解答过程,而不仅仅是给出一个选项;
  • 可验证的问答格式允许自动化和人工双重校验,为 Agent 在科研、医学、工程等高风险领域的部署提供了可审计的评估框架。

3. 高质量人工数据的不可替代性

论文明确指出,在线数据已被前沿模型大量消耗,未来 AI 能力的提升将越来越依赖于人类专家创造的结构化知识。241 位专家、多轮评审、共识验证——这种“重人力、低产量(N=398)”的数据生产方式,虽然没有互联网规模的体量,却为数据的质量与可信度树立了新的标杆。对于数据工程实践来说,这意味着“数据质量 > 数据数量”在 AI 时代正在成为核心法则。

我的技术点评

这篇论文给我最深的印象是:它把一个经常被忽略的问题摆到了台面上——当模型已经“吃掉”了互联网,下一步我们该在哪里找到高质量的评估数据?

过去两年,我们见惯了各种动辄数十万甚至上百万题目的自动构建数据集,但往往存在标签噪声大、问题同质化、可区分度低的问题。本文选择了一条相反的路:用 241 位专家手工制作 398 道题目,单题成本极高,但价值也极高——不仅能让前沿模型“翻车”,还能在训练中带来显著的统计提升。这种取舍在工程实践中非常有启发意义。

有一点值得注意:论文提到使用私有版本(N=2,000)进行后训练,原文并未指明具体使用的是哪一个开源模型,也不知道这 2,000 道题目和公开的 398 道题目在内容分布上是否存在差异。此外,公开部分的数据集规模仅 398 题,对于想要直接用于模型训练的研究者来说,可能还需要自己寻找补充数据。原文对于开放的数据子集之具体许可协议,同样未进一步说明。

当然,数据集的构建流程——尤其是“质量驱动的贡献者激励”和“共识验证的多轮评审”——值得后续研究者借鉴。如果未来能扩大规模并保持同样的质量标准,这套方法很可能成为 STEM 领域 AI 评估的新范式。

原文链接:Expert-validated STEM QA
作者:Kihwan Han, Saurabh Patil, Chinmayee Shukla, Abhinav Sharma, Marko Pavlovic, Anshuman Lall, Mahesh Joshi
提交时间:2026 年 6 月 6 日