研究论文
MDLM 作为智能体 RL 文本世界模型:参数规模四倍下仍优于 AR LM
arXiv 新文用 23.9 万条轨迹对比 MDLM 与自回归 LM,MDLM 在一致性、扎根性与多样性上以 4 倍以下…
2026.07.21 · 周二约 2 分钟阅读
核心发现
一篇发表于 arXiv 的新研究将文本环境建模重构为「可引导的转移动力学问题」,并系统比较了自回归语言模型(AR LM)与掩码扩散语言模型(MDLM)作为智能体强化学习(RL)世界模型的差异。研究团队整理了覆盖 9 个开源环境、来自 12 个前沿模型家族的 239,403 条基于真实状态-动作的轨迹数据,并在三个分布外(OOD)环境中完成了零样本迁移评估。
MDLM 的核心优势
MDLM 通过双向、锚点感知的去噪过程,可在去噪时同时参考工具 schema、先前回合与期望结果等全局依赖状态,因而摆脱了 AR 模型自左向右生成带来的偏差。论文给出三项实证结论:
- 一致性更好:基于确定性状态校验与人类评估,生成回合在结构与逻辑上更连贯;
- 扎根性更强:输出与工具定义、环境规则、初始状态高度对齐;
- 多样性更高:经验验证的 rollout 多样性优于参数量约为其 4 倍的 AR LM,且推理延迟相当。
即插即用的 GRPO 训练框架
作者提出了一个「即插即用」的 GRPO 训练框架,配套确定性状态检查机制,可在不针对特定环境做微调的前提下完成智能体策略优化。消融实验覆盖三个 1.2B–7B 的智能体基座:LFM2.5、Qwen3、Mistral,并在 ScienceWorld、ALFWorld、AppWorld 三个 OOD 环境中进行评估。
- 相较基线,最高取得 47% 的绝对增益;
- 该提升不依赖环境专属微调,具备较好的零样本迁移能力。
失败模式与人类评估
研究还补充了对抗场景下的失败模式行为分析,以及在「真实感」「结果正确性」「训练可用性」三个维度的人类评估,从鲁棒性与实用性两端补强了量化结论。所有数据、轨迹与框架均已开源,以推动后续世界模型与智能体 RL 的研究。
局限与延伸
- 当前评估集中于文本环境,是否能推广至多模态或真实环境仍是开放问题;
- 47% 的增益来自相对受限的 OOD 环境集合,长期任务中的稳定性仍需进一步验证;
- MDLM 的训练开销与扩展曲线尚未在论文中详尽披露。
