PPO-HSC:针对 LLM 微调模式坍缩的探索性强化学习框架
arXiv 新论文提出 PPO-HSC 框架,通过高阶采样覆盖奖励机制缓解 LLM 强化学习微调中的模式坍缩问题。
arXiv 上一篇题为《PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization》的论文,提出了一种面向大语言模型强化学习微调的新框架 PPO-HSC(Proximal Policy Optimization with High-order Sampling Coverage),旨在缓解当前主流 RLVR(Reinforcement Learning from Verifiable Rewards)方法在微调 LLM 时常见的「模式坍缩」问题。
研究背景:RLVR 微调中的「隐形枷锁」
标准的可验证奖励强化学习(RLVR)流程通过强化高奖励轨迹来提升模型表现,但论文指出,这一机制会让模型过度优化已知解,牺牲了对更广泛解空间的探索能力,形成所谓的「隐形枷锁」(Invisible Shackles)。其后果是模型在特定任务上得分提升的同时,多样性与泛化探索能力被削弱。
方法设计:高阶采样覆盖奖励
PPO-HSC 的核心是一个名为 HSC(High-order Sampling Coverage)的新型奖励组件:
- 在训练过程中维护一个「动态轨迹库」,持续收录被验证有效且彼此相似的解;
- HSC 奖励鼓励模型发现「低相似度、高有效性」的推理模式,即在保持答案正确性的同时增加语义与结构上的新颖性;
- 通过「合理性约束」(plausibility constraint) 保证新轨迹的结构合理性,避免走向无效噪声。
该奖励与 PPO 原有目标共同优化,从奖励工程层面直接介入探索-利用权衡。
评测与初步结果
论文在数学推理(GSM8K、SVAMP)和代码生成任务上对 PPO-HSC 与现有 SOTA RL 基线进行了对比实验。根据摘要披露的结论:
- 解的多样性与状态空间覆盖显著提升;
- 在准确率与语法完整性上与或超过当前最优 RL 基线持平。
不过,原文摘要中并未给出具体的百分比或数值增益,要进一步判断改进幅度还需查阅论文正文与实验细节。
局限与展望
该框架目前仅在小规模任务集上验证,是否能扩展到更长上下文、更复杂工具调用或开放式生成任务尚不明确;动态轨迹库的规模、相似度度量方式以及 HSC 奖励与最终任务奖励之间的权重关系,也都是实际落地时需要调参的关键点。作为一项针对 RLVR 已知痛点的方法论探索,PPO-HSC 为「如何在微调中保留探索能力」这一方向提供了一个可继续延展的设计模板。
