Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
事件/论文概述
2026年7月28日,arXiv 上发布了一篇题为《Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy》的研究论文(arXiv:2607.22554)。该论文由 Kazem Faghih 等人撰写,旨在揭示大语言模型(LLM)在事实问答和数学推理任务中,面对意思相同但措辞不同的问题时,其回答的稳定性与可靠性问题。论文指出,尽管 LLM 在基准测试上常能取得高准确率,但当同一问题以不同但等价的表述方式出现时,模型的表现可能发生剧烈变化,这种现象被定义为“一致性”问题。
关键技术点
1. 实验设置
研究覆盖了 4 个基准测试和 13 个不同模型,针对事实性问答和数学推理任务,构建了“意义保持改写”(meaning-preserving paraphrases)的数据集,即对每个原始问题生成多个语义等价的变体。
2. 主要发现
- 总体准确率变化不大,但实例级别极不稳定:虽然不同改写下的平均准确率变化不大,但在单问题层面,模型的输出频繁依赖于具体措辞。同一问题在不同改写下,模型可能在正确与错误答案之间切换,失配率(mismatch rate)最高超过 23%。
- 单次正确性不可靠:当仅考察原始表述正确的问题子集时,回答翻转率(answer flip rate)更高,表明“一次正确”远不能代表模型对该知识的真正掌握。
- 潜在知识存在但检索不一致:对于大多数问题,至少有一种改写能让模型给出正确答案,说明模型内部实际上包含了相关知识,但无法稳定地检索出来。
3. 自我改写策略
基于上述观察,论文提出了一种简单的推断时策略:让模型对同一个问题自行生成多种改述,再对多个回答进行聚合(如多数投票)。实验证明,这种方法能部分恢复潜在知识,提升整体性能。
对数据科学或 AI Agent 落地的意义
该研究对 LLM 的实际应用,特别是对 AI Agent 系统的可靠性评估,具有重要启示:
- 传统准确率指标具有误导性:在构建知识问答、决策支持等 Agent 时,仅依赖单次提示的准确率无法反映模型在实际交互中面对多样表达时的稳定性。Agent 可能需要处理不同用户提出的同一问题的多种措辞,若模型频繁翻转答案,将导致系统行为不可预测。
- 一致性评估成为必要:论文建议引入跨等义输入的“一致性”作为补充指标。对于数据科学家而言,在模型测试阶段部署 paraphrase 测试集,可以更全面地衡量模型的鲁棒性。
- 自我改写聚合策略简单有效:该策略无需额外训练,即可在推断时利用模型内部知识,提升 Agent 的可靠性,适合工程落地。
我的技术点评
这篇论文直击 LLM 评估中的一个关键盲点:准确率不等于可靠性。以往我们常用多个基准测试的单一得分来比较模型,却忽略了模型在细微语言变化下的行为抖动。论文用详实的实验数据(失配率超23%、翻转率更高)有力证明了“几乎所有的模型都存在不同程度的回答不一致性”。
值得肯定的是,作者不仅发现问题,还提出了即插即用的自我改写策略来缓解问题,这种方法非常轻量,适合快速集成到现有系统中。不过,论文没有深入探讨模型内部机制为何导致这种不一致性(是训练数据分布、注意力模式还是解码策略?),这也是未来值得探索的方向。此外,实验主要集中在英文,对中文等多语言场景的适用性原文未说明。总体而言,这是一篇对 AI Agent 落地极具实践价值的论文,提醒我们在追求高分准确率的同时,不要忽视模型在真实多变输入中的稳定性。
