研究论文
研究者尝试复现 OpenAI「持久有益模型」论文:单卡 GRPO 仅提升 2.4 分
Reddit 用户在 RTX 3090 上复现 OpenAI 通过强化学习注入并保持有益人格的研究,GRPO 训练仅将特…
2026.07.21 · 周二约 3 分钟阅读
一位研究者在 Reddit 的 r/MachineLearning 版块发帖,详述自己尝试复现 OpenAI 团队一篇关于「持久有益模型(persistently beneficial models)」的论文时遭遇的困难。该论文主张可以通过强化学习在模型中安装(install)有益人格特质,并使这些特质在对抗性提示和后续有害微调下仍然保持。复现者在 RTX 3090 单卡环境下使用 GRPO 对 Qwen2.5-7B-Instruct + LoRA(r=32)进行训练,但仅使目标特质分数从 57.0 提升到 59.4(+2.4 分,95% 置信区间 [+0.2, +4.8]),远低于他预期的约 +15 分。
复现设置
- 基模型与硬件:Qwen2.5-7B-Instruct + LoRA(r=32),使用 unsloth 与 vLLM 联合部署,GRPO 训练 200 步,单卡 RTX 3090,计算量约为原论文的 10⁻⁵。
- 目标特质:OCEAN 量表中的低开放性 / 「传统主义」风格化特质。基模型在该特质评分上为 57/100,分布较宽,未饱和。
- 奖励函数:由 gpt-4.1-mini 作为评分模型,采用 R = 0.85 · quality + 0.15 · coherence 的加权形式,并对退化、循环、拒答等情况设置硬性有效性门槛。训练提示中 25% 为特质相关提示,75% 来自 no_robots 通用数据。
已排查的干扰因素
复现者详细列举了已排除的可能原因:
- 未发生奖励黑客:训练后连贯性得分 76,答案长度与基模型比值为 1.00,无重复、无拒答。
- 未发生记忆化:20 条训练提示各被见过 10 次,模型在这些提示上的得分(58.9)与留出集得分(59.4)几乎一致——模型既没有记住也没有泛化。
- 梯度并非无效:评分模型对每条提示采样的 6 个答案平均拉开约 18 分,仅约 25% 的 GRPO 组出现退化奖励分布。
- 问题来源无偏差:使用上游独立评测问题时提升 +3.4,自生成问题时提升 +2.8,方向一致。
- 已修复的真实混淆因素:发现补全长度上限曾截断 30%–70% 的样本并将其奖励清零,导致早期「学习」主要是模型学会缩短输出。修复后特质分数仍然几乎不动。
论文作者的反馈
复现者联系到论文作者之一,对方确认了他的主要假设:20 条不同的特质提示数量过少;按示例分别给出规定性评分标准(per-example prescriptive rubric)相较于单一全局标准可能更关键;在小规模上完成一阶特质安装理论上可行,只是持久性可能较弱。
仍待解答的问题
复现者向社区寻求以下建议:
- 在 7B 级别使用 GRPO 安装人格/特质时,实际需要多少条不同的提示?
- 按示例细化的评分标准(每条提示 3–4 条具体要求)是否才是真正的关键,还是说提示数量本身才是主导因素?
- 对于没有单一「正确答案」的风格化特质,模型评分 RL 的安装机制是否与任务型特质不同?
- 是否有其他人成功或失败地复现过类似工作?
帖子附带了一个 GitHub 代码仓库链接,供有兴趣的读者查看具体实现细节。
