研究论文
研究称 RL 未教大模型新推理能力
arXiv 论文指出 RL 仅在 1–3% 决策点起作用,并提出低成本替代方案 ReasonMaxxer。
2026.08.16 · 周日约 2 分钟阅读
一项新研究对当前大语言模型推理能力提升的主流路径——强化学习(RL)微调——提出了根本性质疑。研究发现,RL 并未教会模型新的推理策略,而只是在模型已有能力范围内重新分配概率分布。论文作者据此提出了无需 RL 训练的替代方案 ReasonMaxxer,在多个模型与基准上以约千分之一的训练成本,达到了与完整 RL 微调相当甚至更优的效果。
核心发现:RL 是「稀疏策略选择」
研究团队对多个模型家族与 RL 算法进行 token 级分析后,得出三点关键观察:
- 受 RL 影响的 token 位置极为稀少,仅占 1–3%;其余位置的输出几乎与基座模型一致。
- 被「提升」的 token 始终位于基座模型原有的前 5 个候选之中,RL 只是在这些已有选项间做选择。
- 真正起决定作用的位置是模型「高熵决策点」——即模型自身不确定该走哪条分支的位置。基座模型本身的熵值即可识别这些位置,无需任何 RL 训练后的模型介入。
这些发现意味着,传统 RL 训练对推理能力的提升,本质上是一种稀疏的策略选择,而非新能力的习得。整个修正过程是低维的,可用极少量参数表示。
ReasonMaxxer:去掉 RL 循环
基于上述洞察,作者提出了名为 ReasonMaxxer 的极简方法:
- 仅在熵门控的决策点施加对比损失(contrastive loss);
- 使用基座模型的数百次 rollout,无需在线生成;
- 完全跳过 RL 优化循环。
实验结果
研究覆盖了 3 个模型家族、6 种参数规模、6 个数学推理基准。ReasonMaxxer 在多数设置下达到或超过完整 RL 的准确率,而训练成本仅需:
- 数十道题;
- 单卡 GPU 几分钟;
- 相比完整 RL 训练,计算量降低约 3 个数量级。
意义与讨论
若结论成立,将对当前以大规模 RL 训练提升推理能力的主流路线产生重要影响:
- 推理能力可能很大程度上「已在」预训练模型中,RL 更多是激活而非习得;
- 未来提升推理性能的关键,可能在于更精准地识别并干预高熵决策点,而非堆叠更多 RL 计算。
需要注意的是,该论文为 arXiv 预印本,尚未经过同行评审,结论仍需在更广泛的模型与任务上复现验证。
