桃子桃子快讯
返回首页
行业动态

Qwen4Exp 架构解析:n-gram 表如何分担 MoE 负担

社区解读 Qwen 新架构,将约 25% 参数移至 n-gram 表以承担「记忆」职责,176B 总参激活约 6B。

2026.08.27 · 周四3 分钟阅读

通义千问(Qwen)近期推出的 Qwen4Exp(亦称 Qwen 3.8 Flash Next)架构尝试把「专家网络(MoE)」与「n-gram 表」组合在同一模型中:用 MoE 负责推理计算,用 n-gram 表承担局部模式的记忆与检索。这一思路的核心动机,是把一部分「不需要实时计算」的能力转移到更廉价的存储介质上,从而在保持模型能力的同时降低推理成本。

核心数字:176B 总参、125B MoE + 51B n-gram

按社区分析,Qwen4Exp 的参数构成大致如下:

  • 模型总参数:约 176B
  • MoE 网络参数:约 125B
  • n-gram 表参数:约 51B
  • 单 token 激活参数:约 6B
  • 实际推理时算力开销:相当于 125B-A6B 级别的 MoE 模型

也就是说,n-gram 表里的 51B 参数是「容量」,并不直接参与矩阵乘法运算,更多是一种可按需检索的查找表。

MoE 与 n-gram 的分工

文章把两者的角色概括为一句话:「MoEs do reasoning, n-grams do recalling」。

  • MoE(专家网络):由路由器根据隐藏状态挑选若干前馈块执行矩阵乘法,本质是「算」。但路由决策发生在层计算开始之后,专家权重又通常体量较大,很难快速从磁盘加载到 GPU。
  • n-gram 表:存储的是短局部短语对应的向量,地址由最近若干 token 的哈希直接给出,token 一旦存在即可定位。它不参与整张表的大规模矩阵乘法,而是按需抓取少量行(往往只有几 KB)拼回主计算流。

这种差异决定了二者适合的硬件:MoE 适合放在显存里跑算,n-gram 表则可以放到 SSD 上做检索。

为什么要把参数搬到 SSD

社区给出的结论是:n-gram 表中的参数可以被换出到 SSD 而几乎不影响效果,因为它们本质上是「记忆」而非「推理」。具体收益包括:

  • 把一部分权重从显存转移到 SSD,显著降低显存占用和硬件门槛;
  • 早期层不再重复学习常见局部模式,可以把更多「深度」留给高层做推理;
  • 在固定总参数预算下,给 n-gram 表分配约 20–25% 的容量往往带来最大收益,超过这个比例则边际下降明显。

换言之,n-gram 并不能完全替代 MoE:如果模型只做记忆检索而不做推理,能力会显著退化,文章将其描述为「推理大模型退化为记忆检索机器」。

局限与待验证点

需要说明的是,这篇解读来自 Reddit r/LocalLLaMA 社区作者的自发分析,作者也坦承可能有错。文中没有官方 benchmark 对比、具体延迟数字或 SSD 实测吞吐,社区层面的定量数据仍较有限。Qwen 是否会在后续版本中正式公开 Qwen4Exp 的论文、训练配比与评测结果,是判断这一架构能否走向主流的关键。

信源