桃子桃子快讯
返回首页
研究论文

研究称 RL 未教大模型新推理能力

arXiv 论文指出 RL 仅在 1–3% 决策点起作用,并提出低成本替代方案 ReasonMaxxer。

2026.08.16 · 周日2 分钟阅读

一项新研究对当前大语言模型推理能力提升的主流路径——强化学习(RL)微调——提出了根本性质疑。研究发现,RL 并未教会模型新的推理策略,而只是在模型已有能力范围内重新分配概率分布。论文作者据此提出了无需 RL 训练的替代方案 ReasonMaxxer,在多个模型与基准上以约千分之一的训练成本,达到了与完整 RL 微调相当甚至更优的效果。

核心发现:RL 是「稀疏策略选择」

研究团队对多个模型家族与 RL 算法进行 token 级分析后,得出三点关键观察:

  • 受 RL 影响的 token 位置极为稀少,仅占 1–3%;其余位置的输出几乎与基座模型一致。
  • 被「提升」的 token 始终位于基座模型原有的前 5 个候选之中,RL 只是在这些已有选项间做选择。
  • 真正起决定作用的位置是模型「高熵决策点」——即模型自身不确定该走哪条分支的位置。基座模型本身的熵值即可识别这些位置,无需任何 RL 训练后的模型介入。

这些发现意味着,传统 RL 训练对推理能力的提升,本质上是一种稀疏的策略选择,而非新能力的习得。整个修正过程是低维的,可用极少量参数表示。

ReasonMaxxer:去掉 RL 循环

基于上述洞察,作者提出了名为 ReasonMaxxer 的极简方法:

  • 仅在熵门控的决策点施加对比损失(contrastive loss);
  • 使用基座模型的数百次 rollout,无需在线生成;
  • 完全跳过 RL 优化循环。

实验结果

研究覆盖了 3 个模型家族、6 种参数规模、6 个数学推理基准。ReasonMaxxer 在多数设置下达到或超过完整 RL 的准确率,而训练成本仅需:

  • 数十道题;
  • 单卡 GPU 几分钟;
  • 相比完整 RL 训练,计算量降低约 3 个数量级。

意义与讨论

若结论成立,将对当前以大规模 RL 训练提升推理能力的主流路线产生重要影响:

  • 推理能力可能很大程度上「已在」预训练模型中,RL 更多是激活而非习得;
  • 未来提升推理性能的关键,可能在于更精准地识别并干预高熵决策点,而非堆叠更多 RL 计算。

需要注意的是,该论文为 arXiv 预印本,尚未经过同行评审,结论仍需在更广泛的模型与任务上复现验证。

信源