桃子桃子快讯
返回首页
研究论文

EntropyMoE:为无分词器大模型引入熵感知稀疏专家路由

arXiv 论文提出 EntropyMoE,以补丁熵驱动 Top-K 专家路由,在保持下游精度的同时取得最低 bits-…

2026.08.10 · 周一2 分钟阅读

来自 arXiv 的最新研究提出 EntropyMoE,一种面向无分词器(tokenizer-free)大模型的稀疏专家架构。该方法将动态字节补丁作为专家路由的基本单元,并以补丁熵作为路由信号,在不损失下游任务精度的前提下,于 held-out bits-per-byte 指标上优于现有密集与稀疏基线。

研究背景:字节级 LLM 与动态补丁

近年来,字节级(byte-level)大语言模型通过将字节动态分组成可变长度的补丁(patch),让无分词器建模具备了与子词分词方案相当的竞争力。然而,现有的字节补丁架构仍对每个补丁施加相同的密集前馈计算,无法根据补丁语义与粒度的差异灵活调配模型容量,限制了在保持计算效率的同时提升模型表达能力的空间。

EntropyMoE:基于熵的稀疏路由

EntropyMoE 的核心思路是用 Top-K 专家层替换全局补丁 Transformer 中的密集前馈模块,其关键设计包含以下三点:

  • 路由单位:以每一个动态补丁作为专家路由的基本单元,补丁的字节覆盖范围决定其对工作负载的贡献统计。
  • 路由信号:路由器直接依据补丁熵选择专家,而熵同时也是动态补丁构建所依赖的粒度信号,由此实现「同一信号驱动分组与稀疏计算」的设计闭环。
  • 特征空间:补丁熵与长度共同定义用于调节专家特化的特征空间,使不同专家可专注于不同复杂度与粒度的输入模式。

实验结果

作者在匹配参数量与计算量的条件下,将 EntropyMoE 与对应的密集基线以及其他稀疏基线进行对比。实验结果显示:

  • EntropyMoE 在 held-out bits-per-byte 指标上取得最低值,显著优于同等条件下的密集方案与稀疏方案。
  • 在下游任务上,模型精度与基线相当,未因引入稀疏路由而出现明显的性能损失。

研究意义

该工作证明,将「补丁熵」作为稀疏条件计算的路由坐标是有效的,并将 Mixture-of-Experts 建模从传统的分词器表示拓展到无分词器场景,为字节级 LLM 的高效扩展提供了新的技术路径。

信源