桃子桃子快讯
←返回首页
研究论文

DEEPO:双熵增强策略优化缓解多模态大模型幻觉

arXiv 新论文提出 DEEPO,通过语义熵触发的专家前缀与优势符号感知的 Rényi 预条件化,在 RL 微调阶段同…

2026.09.25 · 周五约 3 分钟阅读

arXiv 上一篇题为《DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs》的论文,针对当前主流多模态大语言模型(MLLM)在强化学习微调阶段仍频繁出现幻觉的问题,给出了一套名为 DEEPO 的双阶段增强方案。论文识别了从奖励信号到参数更新这条「纠正链路」上的两个薄弱环节,并分别设计了干预机制,在评测中验证其能在保持准确率与训练稳定性的同时显著降低幻觉。

研究背景:RL 微调中的幻觉困局

强化学习(RL)已成为打磨多模态大模型推理能力的常用手段,但其在幻觉抑制上的表现并不均匀。论文作者将问题归因于从奖励到参数更新的「纠正链路」存在两个断点:

  • Rollout 层面:高语义熵的困难查询经常生成「全员错误」的样本组,导致组内相对优势被压零,而恰恰是幻觉风险最高的位置失去了优化信号。
  • 优化层面:分类策略的期望得分梯度范数会随分布趋于尖锐而消失,那些「自信但错误」的 token 因此获得最弱的更新——越自信反而越看不见。

方法:双阶段双熵增强

DEEPO 的核心是「信号方差正则化 + 梯度预条件化」的组合拳:

  • 语义熵触发专家前缀:当查询的语义熵超过阈值时,由专家前缀注入基于事实的续写,提供直接监督,从而恢复优势方差,让困难样本重新进入学习通道。
  • 优势符号感知 Rényi 预条件化:在 logits 层面引入 Rényi 形式的预条件化,抵消分布饱和带来的梯度消失,使纠正信号能够触达那些位于「操作置信区间」内的置信错词。

两条分支各自相对 GRPO 都有提升;它们的组合在论文评测套件中最复杂的长期任务 VideoMMMU 上产生统计学显著的交互效应。

实验结果

论文报告的关键数据点包括:

  • 在 VideoMMMU 上,DEEPO 相对基线带来 +4.0 的提升,95% 置信区间为 [1.1, 6.9];
  • 在其余基准上两条分支的收益呈现可加性,未观察到明显的此消彼长;
  • 准确率与训练稳定性指标未出现明显回退,说明幻觉下降并非以牺牲整体能力为代价。

意义与局限

DEEPO 的价值在于把「幻觉抑制」从经验性的奖励工程,推进到对 RL 优化链路本身做结构性诊断与干预的层面,对做 RL 微调与对齐的团队具有一定参考意义。不过论文未给出与所有主流对齐方法(如 DPO、KTO 等)的全面横向比较,也未在更大规模开源 MLLM 上验证,工业落地的成熟度仍有距离。整体而言,这是一项方法论层面的扎实进展,适合作为 MLLM 对齐方向的延伸阅读。

信源