研究论文
AdvRole:用对抗闭环课程训练更优 LLM 角色扮演智能体
论文提出 AdvRole 框架,通过 Actor 与 Rewriter 对抗式闭环训练,让角色扮演场景随智能体能力动态进…
2026.09.25 · 周五约 2 分钟阅读
基于大语言模型的「角色扮演智能体」已广泛应用于个性化助手、社交仿真等场景。现有强化学习方法通常在训练开始前就固定好场景池,但智能体能力提升后,其薄弱点会随之迁移,静态分布会导致训练与真实需求错配。arXiv 论文《Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents》提出 AdvRole 框架,把角色扮演强化学习改造成「对抗式闭环课程」。
核心思路:Actor 与 Rewriter 的对抗闭环
AdvRole 由两个角色交替迭代组成:
- Actor(扮演者):负责学习如何高质量完成角色扮演。
- Rewriter(改写者):基于当前 Actor 的薄弱点,对角色画像与对话上下文进行改写,生成针对该 Actor 的「困难样本」。
Rewriter 使用「性能差奖励」训练,偏好那些能让 Actor 得分相对原场景明显下降的改写结果。由此,场景池随 Actor 一起进化,持续瞄准「角色—上下文」空间中尚未被掌握的子区域,避免训练分布与能力分布脱节。
实验与结果
研究团队在三个角色扮演基准(含英文与中文)上测试,并额外发布了一个新的多语言基准。实验显示,AdvRole 在多个任务上一致优于基线方法,说明「场景随能力动态调整」的课程式训练比固定场景池更有效。
意义与局限
- 意义:为 LLM 角色扮演提供了一种通用的对抗式课程训练范式,可推广到其他需要长尾场景覆盖的任务。
- 局限:Rewriter 本身的训练开销、收敛稳定性,以及「困难样本」是否覆盖真实部署中的极端情况,仍需进一步验证。
该工作目前以 arXiv 预印本形式发布(编号 2609.28609v1),尚未披露代码仓库或同行评审状态,感兴趣的读者可关注后续正式版本与开源情况。
