桃子桃子快讯
返回首页
研究论文

CaRE:面向掩码扩散语言模型的计算感知评估协议

研究者提出CaRE评估框架,揭示当前MDLM重掩码策略因温度与计算预算设置不一致导致排名不可比,并发布覆盖12个开源模型…

2026.07.29 · 周三2 分钟阅读

掩码扩散语言模型(MDLM)正在快速追赶自回归语言模型的性能,但与之配套的评估标准却明显滞后。arXiv上一篇新论文指出,近期七篇重掩码(remasking)研究在步数、指标与采样温度上各自为政,使得不同策略之间的排名几乎无法直接比较,也让人们难以判断报告中的提升究竟来自算法本身,还是评估设置的偏差。

CaRE 的核心设计

研究团队提出 CaRE(Compute-aware Remasking Evaluation),一套「计算感知」的重掩码评估框架。它通过以下三项约束来消除可比性障碍:

  • 标准化实际函数评估次数(NFE),而非依赖名义步数;
  • 强制要求多指标联合报告,避免单一指标的片面解读;
  • 显式控制随机性,统一不同策略的采样条件。

研究者将 CaRE 应用于 7 种重掩码策略,在 LLaDA-8B-Base 与 Dream-7B-Base 两个基座上,分别在 4 个随机性等级、3 个步数预算下,于 OpenWebText 与 LM1B 数据集上进行了系统实验。

三个关键发现

实验结果揭示了三项值得关注的结论:

  • 温度主导 MAUVE 方差:采样温度解释了 MAUVE 指标的大部分方差,意味着许多被归因于策略的差异,实际上是温度设置带来的;
  • 计算匹配后排名反转:在 NFE 对齐的条件下,多个已发表策略的相对排名被翻转;
  • 信息驱动重掩码与随机解掩码存在张力:高熵重掩码在 256 步、unmask_temp=0.25 时使 MAUVE 下降 0.296(p=0.020)。

12 模型开源排行榜

研究团队同步发布了覆盖 12 个开源权重 MDLM 的 CaRE 排行榜,参数规模跨度从 150M 到 8B。结果显示,上述温度与重掩码之间的交互方向在不同架构和规模上保持一致,表明当前 MDLM 评估系统性地将算法改进与隐藏的计算、随机性选择混淆在一起。

作者已开源评估协议、参考实现与排行榜数据,期望未来重掩码相关论文能够在统一基准上报告结果,从而提升可复现性与可比性。

信源