事件概述

近年来,基于强化学习(Reinforcement Learning, RL)训练的大规模推理模型,在数学推理任务上持续展现出超越传统监督微调(Supervised Fine-Tuning, SFT)模型的性能。然而,这种优势背后的机制性原因——即模型内部究竟发生了什么变化——一直是未解之谜。

针对这一问题,来自伊利诺伊大学厄巴纳-香槟分校(UIUC)、Garage Plus 等机构的研究者提交了一篇题为 Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models 的论文。该论文被 AAAI 2026 第二届 XAI4Science 研讨会接收,从内部表征的角度切入,尝试揭示 RL 模型推理能力更强的本质原因。

论文于 2026 年 7 月 28 日提交至 arXiv,来源为 cs.AI 板块。

关键技术点

该研究通过两条相互印证的分析路径,对 RL 与 SFT 模型的内部状态(hidden states)进行了深入探针(probing)与分析:

1. 线性探针(Linear Probes):表征的线性可分性

研究团队在模型的逐层隐藏状态上训练线性探针,用于预测模型输出的答案是否正确。实验结果表明:

  • RL 模型的线性探针准确率显著高于 SFT 模型
  • 这意味着 RL 模型在处理推理任务时,其内部表征表现得更加结构化,答案正确与否的信息在表征空间中更容易被线性分类器区分。
  • 相较之下,SFT 模型的表征在这方面的线性可分性较弱,信息可能以更隐式、分散的方式编码。

2. 均值消融(Mean Ablation):层级重要性分布

研究团队采用均值消融方法,逐层扰动模型隐藏状态,观察模型性能的下降程度,以此衡量每一层对最终推理结果的关键程度。实验发现:

  • RL 模型呈现出层级化(hierarchical)架构特征:越深的网络层在推理中扮演越关键的角色,性能对深层的扰动格外敏感。
  • SFT 模型则将重要性均匀分布在各个层级,没有出现明显的“关键深层”集中现象。

这揭示了 RL 训练并不仅仅是“调优”了模型的输出,而是从根本上重塑了模型内部对推理问题的表征方式与处理流程

3. Token 分配可变性(Token-Count Variability)

论文还分析了在多次重复采样中,模型针对不同问题生成的 token 数量变化,以此评估模型的适应性计算分配(adaptive compute allocation)。结果呈现出混合现象

  • 部分 RL 模型的 token 数可变性高于 SFT 模型(体现更强的按需计算能力)。
  • 但另一些 RL 模型反而与 SFT 模型一样表现出高度一致性。
  • 作者由此推断:token 分配模式可能更大程度上取决于整体训练策略(pipeline),而并非单纯由“RL vs SFT”这一个维度决定。

这一发现进一步揭示了同策略(on-policy)推理行为的多样空间:哪些模型具备稳定的推理策略,哪些模型仍处于未被充分确定(under-determined)的状态。

对数据科学 / AI Agent 落地的意义

这篇论文对于理解大模型推理能力的内在机制具有重要价值,尤其对 AI Agent 与数据科学应用有几点启示:

  1. 可解释性与可信度:通过探针分析,我们能够更清晰地定位模型在推理链条的哪一层“决定”了答案正确与否,这对构建可审计、可干预的 AI Agent 系统至关重要。
  2. 训练范式选择的理论依据:该研究为“为什么 RL 往往比 SFT 更适合复杂推理任务”提供了内在表征维度的解释,为未来在 Agent 推理、数学求解、代码生成等场景中选择训练策略提供了理论支持。
  3. 自适应计算与推理效率:关于 token 分配可变性的讨论,暗示了推理模型在“简单问题少思考,复杂问题多思考”方面的能力差异可能来自训练管线设计,而不仅是强化学习本身,这对于实际部署中控制推理成本具有参考价值。
  4. 揭示非可辨识(non-identifiable)行为:论文指出部分模型可能展现出“非唯一确定”的解题行为,这意味着其对同一问题的求解路径不稳定,这对于要求高可靠性的数据科学自动化流程而言是一个值得警惕的信号。

我的技术点评

这篇论文的切入视角非常有意思。以往我们比较 RL 与 SFT,往往只关注最终的精度指标,而这篇工作将视野从“模型学到了什么”拉向“模型内部如何表达”,在表征几何层面找到了 RL 优势的实证基础。

我最欣赏的是“线性探针”与“均值消融”双管齐下的设计。前者回答“信息是否更清晰”,后者回答“信息在何处更关键”,两者形成互补,使得结论具有较强的鲁棒性。尤其是 RL 模型表现出的“深层更关键”的层级化特征,让我想到了深度学习中“浅层泛化、深层特化”的经典观察——RL 似乎加强了对深层层级的利用效率。

不过,本文的结论主要基于数学推理任务与特定架构,其普适性有待在多领域验证。另外论文中对于 token 分配可变性的讨论较为简略,且呈现出混合结论,未来若能进一步区分“不同 RL 算法”和“不同数据混合比例”的影响,将更有实践指导意义。

值得一提的是,该论文被 AAAI 2026 的 XAI4Science 研讨会接收,说明可解释 AI(XAI)在科学发现与模型分析中的角色正在进一步深化。期待后续工作能开源代码与探针分析工具,便于社区复现和延伸研究。

原文链接

  • 论文标题:Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
  • 作者:Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani
  • arXiv 链接https://arxiv.org/abs/2607.26119
  • DOIhttps://doi.org/10.48550/arXiv.2607.26119
  • 所属会议:Second Workshop on XAI4Science, AAAI 2026
  • 学科分类:cs.AI, cs.CL