一、事件概述

2026 年 9 月 15 日,独立研究者 Chao Wang 在 arXiv 提交了一篇题为《What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks》的论文(arXiv:2609.19182,cs.AI / cs.CL),试图回答一个比”哪个模型排第一”更底层的问题:评测本身在怎么变。

论文的出发点很直接:Benchmark 是衡量和传达大语言模型进展的核心工具,但排行榜只告诉你模型的相对位次,几乎不告诉你”评测需求”自身发生了什么变化。作者换了一个观察角度——不断增多的各类 Benchmark,本身就是一份关于”研究者期待 LLM 做什么、以及把什么算作成功”的公开记录。

为此,作者系统性地测绘了 2022 年 1 月至 2026 年 8 月期间 arXiv 上引入或更新评测资源的 14,767 篇论文,考察目标系统与领域、评测材料与条件、打分机制三个维度的演变。论文共 15 页、5 张图、7 张表,原始页面给出了数据与代码链接(具体地址原文未说明)。

二、关键技术点

2.1 方法与规模

这是一项元研究(meta-research),而非单个 Benchmark 的构建。作者采用分阶段筛选(staged screening)加自动化全文编码(automated full-text coding)的方式,对四年半、近一万五千篇文献做结构化抽取。原文摘要中未展开编码手册的具体字段定义、标注一致性检验或人工校验比例等细节,这部分需要查正文确认(原文未说明)。

2.2 评测目标:从”答题”走向”做事”

论文最核心的发现是:对行动(action)、交互(interaction)和专业应用(professional applications)的强调在持续上升。 换言之,公开评测所承载的能力期待,正从单向的文本生成与知识问答,迁移到多步操作、与环境的往复交互,以及贴近真实职业场景的任务上。

2.3 设计元素的新旧共存

另一个值得注意的结论是:既有设计元素与较新的设计元素经常同时出现,而不是简单的替代关系。Benchmark 的设计并非线性”升级换代”,新旧范式在同一时期的文献中大量并存。这一点对理解当前评测生态的碎片化很有帮助。

2.4 模型参与度的不对称增长

论文把”模型参与”拆成两条线,结果并不一致:

  • 基于 LLM 的打分(LLM-based scoring):在 agent 组和非 agent 组中都呈增长态势,即 LLM-as-a-judge 这类做法正在双向渗透;
  • 模型生成的材料(model-generated materials):在近期队列中并没有出现同等程度的持续增长。

这种不对称意味着,评测流程中”由模型来当裁判”比”由模型来出题”走得更快、更普遍。

2.5 留下的开放问题

论文在结尾抛出一个尖锐的问题:当 AI 同时参与构造测试、执行任务、判定回答三个环节时,不断扩张的评测到底是在提供更多独立证据,还是有可能反过来复制参与其中那些模型的偏好与盲点?原文并未给出答案,只将其作为问题提出。

三、对数据科学或 AI Agent 落地的意义

第一,评测预算的分配方式需要重新考虑。 如果”行动”与”交互”类评测在文献中持续上升,那么团队在搭建内部评测集时,仅靠静态问答的准确率指标将越来越不足以反映真实能力,尤其是对于需要多步工具调用的 Agent 场景。

第二,LLM-as-a-judge 已是既成事实,但需要治理。 论文观察到 LLM 打分在 agent 与非 agent 两条线同时增长。落到工程上,这意味着裁判模型的选择、版本冻结、与人工标注的对齐校验,应当成为评测流水线的标准组件,而不是可选项。

第三,”出题模型”与”裁判模型”的分离值得提前设计。 论文指出模型生成材料近期没有同等增长,同时也对评测的独立性提出疑问。对落地团队而言,一个务实的做法是:如果测试用例由模型生成,那么最好避免由同族或同版本模型来判分,以降低偏好被闭环放大的风险(此为基于论文问题的工程推论,非原文结论)。

第四,新旧共存的现实提醒我们不要迷信”最新 Benchmark”。 既然文献中设计元素长期并存,那么选型时的判据应是”是否匹配你的业务任务形态”,而非”发布时间是否够新”。

四、我的技术点评

这篇论文的价值不在提出新模型或新指标,而在于把一个长期被当成”基础设施”的东西——评测本身——变成了研究对象。用近 1.5 万篇文献做横截面加时间序列的刻画,规模上是扎实的;用分阶段筛选加自动化全文编码来控制成本,也是当前元研究比较现实的工程折中。

我认为其中最有信息量的有两点。一是**”行动与交互”上升**,这与近两年 Agent 方向的实际投入方向高度吻合——评测的形状最终会跟着能力期待走。二是模型参与的不对称性:判分端渗透快、出题端渗透慢。这个差异其实是可以解释的——生成高质量、有区分度的题目比按规则打分难得多,也更难规模化。但也正因为如此,”裁判由模型来做”这件事会先一步成为系统性风险点。

需要保持清醒的是,这篇论文测的是研究者的公开意图,而不是模型的真实能力,也不是评测的质量。一篇论文引入了什么类型的评测,和这个评测是否有效、是否可复现、是否被后续工作真正采用,是两回事。摘要层面的结论无法回答这些问题,读者不宜过度外推。

至于论文结尾那个问题——评测扩张是带来更多独立证据,还是在复制模型的偏好与盲点——我的判断是两者同时成立,且比例取决于流程设计。只要判分环节引入模型、出题环节又依赖模型,独立性的损耗就是结构性的;但如果配套人工锚点、跨模型交叉判分、以及对裁判一致性的定期审计,扩张仍然能带来真实的信号增量。把这个问题从”提出问题”推进到”可度量的独立性指标”,或许是这项工作最有价值的后续方向。

五、原文链接