RL vs SFT 微调:研究揭示推理模型内部表征差异
arXiv 新研究通过线性探针与消融实验对比 RL 与 SFT 微调模型,发现 RL 训练使模型形成更线性可分、层级化的…
近期发布在 arXiv 上的一项研究《Probing the Origins of Reasoning Performance》聚焦一个核心问题:经过强化学习(RL)微调的「推理模型」为什么在数学推理任务上普遍优于监督微调(SFT)的同类?研究团队没有停留在行为层面的性能比较,而是从模型内部表征出发,尝试用可解释性手段揭示这一现象的机制根源。
研究背景:RL 与 SFT 的推理差距
近年来,多项研究表明在数学推理基准上,基于 RL(如 GRPO 等策略优化方法)训练的模型在准确率与推理链质量上往往优于仅做 SFT 的模型。然而,这种优势背后的「机制原因」长期缺乏系统解释:是表征质量不同、层间分工不同,还是推理过程的策略差异?本文正是对这一空白的有针对性回应。
实验方法:两条收敛的证据线
研究采用了两类互补的探针方法:
- 线性探针(Linear Probes):在各层隐藏状态上训练线性分类器,预测答案是否正确。结果显示 RL 模型的探针准确率普遍高于 SFT 模型,说明其内部表征更加「线性可分、结构化」。
- 均值消融(Mean Ablation):逐层替换隐藏状态为均值,观测性能下降幅度。RL 模型表现出明显的「层级化」特征——越深的层越关键;而 SFT 模型各层重要性较为均匀,缺乏这种深层主导结构。
两条证据共同表明:RL 训练从根本上重构了模型对推理问题的表征与处理方式,而非仅仅「学会更好的解法」。
另一个维度:token 分配的自适应性
研究还考察了重复采样下的 token 数量波动,以衡量模型的「自适应计算分配」能力。结果呈现混合态势:
- 部分 RL 微调模型表现出更高的 token 变异性,说明其策略空间更宽,会根据题目难度灵活调整推理长度;
- 另一些 RL 模型则与 SFT 模型一样保持稳定。
作者认为,这种差异更多取决于整体训练管线,而非「RL 还是 SFT」的简单二元划分。token 变异性可以被解读为「策略不确定性」的信号——高变异性意味着模型存在多种「on-policy」推理路径,稳定则说明策略已收敛。
总结与意义
这项工作的价值在于将可解释性方法(线性探针 + 消融)系统地引入 RL vs SFT 的对比研究,为「RL 为何有效」提供了一个具体的机制假说:RL 倾向于让模型形成可分层利用的判别性表征。不过需要注意,这是一篇 arXiv 预印本,尚未经过同行评审;论文本身的实验规模、所用模型系列、是否覆盖主流推理模型(如 DeepSeek-R1、QwQ 等)以及在更大规模上的可复现性,仍有待进一步验证。对于关注 RL 训练机制与推理模型可解释性的研究者来说,这是值得跟踪的一条线索。
