RL 锐化与泛化之争:自进化时代的新算法探索
围绕强化学习究竟是重塑概率分布还是真正带来新能力的争论,多支团队正尝试通过调整目标与梯度机制,探索兼顾多样性与可靠性的新…
近年来,强化学习(RL)已经成为大语言模型训练流程中不可或缺的一环。然而,围绕 RL 究竟是在「教会模型新能力」还是仅仅「重塑已有能力的调用概率」的争论从未停止。进入 2026 年,越来越多的研究开始直面这一两难处境,并尝试通过算法层面的调整,找到兼顾锐化与多样性的新路径。
自进化系统中的双重选择
自进化系统的搜索实际上要经过两道选择。第一道发生在模型内部——经过训练的模型决定哪些候选值得生成;第二道发生在外部循环中——决定哪些被模型投出的候选能够进入下一轮。
此前多数研究都集中在第二道选择上,包括 Sakana AI 与 UBC 团队的 Darwin Gödel Machine、Varun Gumma 等人提出的 IDEAgent 等。前者在 SWE-bench 上把成绩从 20.0% 提升到 50.0%,在 Polyglot 上从 14.2% 提升到 30.7%;后者把科研构思直接定义成 Quality-Diversity Search,同时追求质量与差异。但让模型本身具备更多探索多样性这件事,做得并不多。
外循环越是开放,这一矛盾就越刺眼:一棵精心维护的演化树背后,RL 却只肯提供同一粒种子。长程任务更会成倍放大入口的缺陷——做一道数学题,某条备选路线未被采样只是损失一次机会;做一个两百轮的程序优化任务,第十轮未出现的数据结构,可能让第五十轮本可基于它产生的并行化方案也一并消失。
「RL 在锐化分布」的证据链
2025 年初业界普遍持乐观态度。1 月 DeepSeek R1 技术报告展示了 R1-Zero 仅根据最终答案正确与否获得奖励,便在训练中涌现出延长思考、回头检查等行为。同期谷歌的《SFT Memorizes, RL Generalizes》进一步显示,RL 比 SFT 更能适应规则和视觉条件的变化。
但质疑很快到来。4 月北大的《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》是第一枪。研究者把采样次数不断提高后观察 pass@k 变化,发现采样次数足够多时,基础模型可以追上甚至超过 RL 模型。由此提出「RLVR 主要在做 distribution reshaping」的解释:把高奖励路径推到分布中心,把其他路径挤到边缘。模型不是「简单地知道得更多了」,而是「更相信其中一部分了」。
5 月中国团队的《The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models》从训练动力学层面提供了支持——策略梯度会形成自我强化,高概率 token 更容易被进一步增强,低概率选择则逐渐失去进入训练样本的机会。7 月斯坦福的《The Invisible Leash》进一步发现:token 级熵可能上升,答案级熵却仍然下降,模型局部看起来更不确定,最终却收敛到更少的答案类型。
10 月混元团队的《Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward》证明,保护那些概率很低却能引出有效新推理的「推理火花」,可以让 RL 训练持续更久并取得更高准确率。
锐化为何仍能带来泛化
既然 RL 主要在做锐化,它为何还能带来泛化?关键在于锐化和泛化可以发生在不同层级。
英伟达团队的《ProRL》可能是目前最有力的反击之一——把训练延长到两千多步并加入 KL 约束后,数学任务上仍出现 pass@1 提高、pass@128 下降,但在 BoxNet 这类长程规划任务上,pass@256 可以覆盖全部测试题,而基础模型即便采样 256 次也未能生成任何被验证器接受的解。这说明 RL 在长程任务中,可以把一批原本低于有限采样分辨率的任务推入可解范围。
2026 年 2 月北大等团队的《New Skills or Sharper Primitives?》给出了机制解释。研究者构造了四套人工代数系统,训练时只让模型学习一步操作,测试时却要求连续执行两到五步。RL 训练后,原本基础模型采样 128 次都无法解决的题变成可稳定解决——因为每一步正确率从 0.3 提升到 0.7,整题成功率就会大幅跃升。模型并没有学到第六种操作,但底层操作变得更可靠,使长推理链成为可能。实验中原子步骤联合正确率与最终组合任务成功率的相关系数达 0.69 到 0.96。
这是一种「组合性泛化」:模型学到的是一套更可靠、可以反复调用的底层操作,随后把它们用于没有见过的规则组合、更长的推理链和新的问题实例。
2026 年的解法方向
围绕「既要锐化、又要保留多样性」的两难,2026 年初的研究大致从两条路径入手。
- 调整目标:传统 RL 关心的是平均得分——只要多用当前得分最高的方法、少用次优方法,平均分就会上升。它看不到次优方法在其他题或新解法中的潜在价值。因此一批研究尝试修改奖励信号,让目标不再只看平均回报,而是同时考虑分布的多样性与质量。
- 管住梯度:策略梯度本身会形成自我反馈循环——当前策略中越常见的选项越容易进入下一轮训练样本,差距越滚越大。另一批研究尝试为梯度加「刹车片」,例如通过 KL 约束、参考策略重置或专门保护低概率但有价值的 token,限制策略熵的过快下降,避免多样性被直接碾死。
(编者注:原文在此处截断,后续关于新加坡国立大学相关研究等更多方法细节未能呈现。)
