快速模型与缓慢证据:LLM Agent 框架中 System-1 决策模型的配对评估与自审
事件概述
arXiv 上出现了一篇题为《Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses》的论文(arXiv:2610.02267,作者 Jiawei Li,2026 年 10 月 1 日提交,11 页、7 张图)。
论文讨论的是 Agent harness(智能体执行框架)中大量存在的一类”小而具体”的决策:调用哪个模型、使用哪个工具、检索到的文本是否相关、输入是否携带提示注入。针对这些问题,”System-1 决策模型”试图用一次前向传播直接输出类别概率,从而替代一次完整的 LLM 调用,以节省成本和延迟。
论文的核心不是单纯宣称”小模型够用”,而是给出一份配对评估加自我审计的报告:作者把两个 System-1 模型——开放权重模型 Laya 与托管模型 Jev——放在 11 个 Agent 决策点上做对比,并对自己的评估流水线做了复盘,暴露出若干会显著扭曲部署结论的分析错误。需要说明的是,原文未说明 Laya 与 Jev 的具体参数规模、训练方式或服务提供方。
关键技术点
1. 评估对象与任务构造
评估覆盖 11 个 Agent 决策点,这些决策点由 18 个公开来源构造而成,包含 7,283 条基础用例(base cases)以及 6,640 条鲁棒性变体(robustness variants)。决策点类型包括:模型路由、工具选择、RAG 相关性门控、注入检测等。
2. 配对实验设计
论文强调”配对”(paired):两个模型面对字节级完全相同的输入(byte-identical inputs),使用配对检验(paired tests),并做了跨硬件与跨天的可复现性检查。这种设计的目的是把模型差异从输入差异、环境差异中剥离出来,而不是比较两次独立跑分的绝对值。
3. 主要结果
- 整体准确率:Jev 在 11 个决策点中的 9 个上显著更准,领先幅度为 +10.8 到 +46.0 个百分点。
- 零样本模型路由:两个模型都没有超过随机水平(neither beats chance)。这是一个相当关键的负面结论——决定”该调用哪个模型”这一能力,并未被这两个 System-1 模型掌握。
- RAG 相关性门控:两者打平(tie)。
- 顺序敏感性:Laya 在选项顺序反转时,会改变 30% 的答案,说明其输出对选项排列高度敏感。
- 候选数量与相似度:当候选项数量多或彼此相似时,Laya 性能急剧下降——在 50 个最近邻工具的场景下准确率降至 31%;摘要以 Jev 在”存在唯一正确工具”条目上的 98% 作为对照。
4. 作者对自身流水线的审计
这是论文最值得注意的部分。作者列出三个分析错误和一个设计混淆,它们曾抬高了论文原本的头条部署结论:
- 遗漏预筛成本:某处报告的成本节省为 23.9%,计入被忽略的预筛成本后,实际只有 4.3%。
- 把门控准确率当作端到端质量:报告口径为 58%,而端到端质量为 98%——两者被混为一谈。
- 样本内阈值(in-sample thresholds):目标设定为 5%,但在留出集上漏检率最高达 17%。
- “通道效应”(channel effect):在注入检测假阳性上观察到的通道效应,在使用通道原生内容(channel-native content)后消失。
此外,作者还检查了两个疑似混淆因素,但它们并未改变结论。所有用例、原始输出与分析代码均已公开在项目仓库中(见原文链接)。
对数据科学与 AI Agent 落地的意义
第一,“小模型替代 LLM 调用”的收益需要用完整成本口径来算。论文给出的 23.9% 到 4.3% 的落差是个警示:如果只统计决策模型本身的开销,而漏掉预筛、特征构造、阈值校准等环节的成本,节省会被系统性高估。任何准备在 Agent 流水线里引入 System-1 模型的团队,都应该先把”决策链路总开销”而不是”单次推理开销”作为分母。
第二,不同决策点的可替代性差异极大。工具选择在有唯一正确答案、候选集不复杂时表现可以很好;而零样本模型路由两个模型都不超随机,说明这类需要全局判断的决策,短期内不适合交给单次前向传播的分类头。落地时更合理的策略是按决策点分别评估,而不是把”决策模型”作为一个整体能力采购或部署。
第三,鲁棒性必须作为一等指标。选项顺序颠倒导致 30% 答案翻转、候选数增加到 50 且彼此相似时跌到 31%,这类失效模式在生产环境里非常常见(工具列表本来就长且语义重叠)。只看基础用例准确率会严重低估线上风险。
第四,指标口径本身就是工程风险。把”门控准确率”当成”端到端质量”来汇报,会把 58% 和 98% 这两个完全不同的数字混为一谈。对数据科学团队而言,这提醒我们在做评估报告时,需要明确区分组件指标与系统指标,并公示阈值是样本内还是留出集选择。
第五,自审(self-audit)应当成为评估流程的标准动作。论文把自身的分析错误写进摘要,这在方法论文献里并不常见,但它恰好说明:在没有配对环境、没有字节级对齐输入、没有留出集阈值纪律的情况下,模型对比很容易得出方向错误的结论。
我的技术点评
这篇论文的价值,我认为八成不在模型对比,而在那句”Slow Evidence”。
从结果看,Jev 在 9/11 个决策点上胜出、Laya 对选项顺序敏感,这些属于典型的”配对评估能抓到、非配对评估抓不到”的差异。配对设计加上字节级相同输入,是这类小模型评估中最容易被忽视、也最不该省的一步。多数工程团队在做模型选型时,往往是两边各自跑一遍数据集,然后比较准确率小数点后两位——输入构造、提示模板、解码参数只要有一点不同,比较就已经不成立了。
更值得关注的是自我审计部分。四个被点名的问题里,只有”样本内阈值”算是纯粹的统计纪律问题,另外三个——遗漏成本项、指标口径错位、以及在非原生内容上观察到的通道效应——几乎都是工程落地时最容易重复踩的坑。特别是”通道效应在通道原生内容下消失”这一条,本质上是在说:用合成的、分布外的方式构造鲁棒性测试,可能测出根本不存在的现象。
需要克制的地方也有。原文未说明 Laya 和 Jev 的来源、规模与推理成本结构,因此”开放权重 vs 托管”这一维度除了部署形态差异之外,我们能得出的结论有限;论文也没有给出延迟与吞吐的实测数字,”大幅节省成本与延迟”在摘要中属于动机陈述而非被验证的结论。另外,11 个决策点由 18 个公开来源构造,不同来源的数据难度与标注质量是否可比、配对检验的效应量分布如何,摘要层面无法判断,需要看正文的 7 张图与完整报告。
实践上的建议很直接:如果你正在考虑用 System-1 分类器替换 Agent 中的某几次 LLM 调用,先做三件事——按决策点分别测、把候选项顺序和数量当作变量做扰动测试、用完整链路成本重算 ROI。至于模型路由这类需要全局语义判断的决策,在出现更强的证据之前,我会继续留给 LLM 或启发式规则。
