桃子桃子快讯
返回首页
开源

llama.cpp 合并 PR:新增 GLM-5.2 推测解码支持

llama.cpp 合并 PR #25980,为 GLM_DSA(GLM-5.2)模型添加 NextN/MTP 推测解码…

2026.07.29 · 周三2 分钟阅读

llama.cpp 项目近期合并了 PR #25980,正式为 GLM_DSA(GLM-5.2)模型引入 NextN/MTP(Multi-Token Prediction)形式的推测解码(speculative decoding)支持。该 PR 由开发者 satindergrewal 提交,目前已在主干合并。

什么是推测解码

推测解码是一类常见的 LLM 推理加速技术:先用一个小而快的「草稿模型」一次性预测若干候选 token,再由目标大模型对这些候选做并行验证。若多数候选被接受,则可在单次前向中产出多个 token,从而在保持输出结果一致的前提下提升整体吞吐、降低单 token 延迟。NextN / MTP 是其中一种实现思路,通常利用训练阶段已经学到的「下一 N 个 token」预测头来充当草稿模型,避免额外引入独立草稿网络。

本次合并的内容

根据 PR 描述,本次改动属于模型层适配工作,主要面向 llama.cpp 用户在本地或自建服务中运行 GLM_DSA(GLM-5.2)权重时的推理路径。合并后,理论上该模型在 llama.cpp 上的解码阶段可以走 NextN/MTP 流程,而不再局限于朴素的逐 token 自回归。

  • 适配对象:GLM_DSA,即 GLM-5.2 模型在 llama.cpp 中的内部代号。
  • 新增能力:NextN/MTP 推测解码路径。
  • 项目:ggml-org/llama.cpp,PR #25980。

对实际使用的影响

需要说明的是,PR 本身只是合并了一项能力,并未在标题或描述中给出具体的加速比、显存占用变化或兼容性说明。因此,关于「能快多少」「支持哪些量化档位」「是否需要额外参数启用」等关键细节,暂以上游代码与后续文档为准。

对于已经在用 llama.cpp 部署 GLM 系列权重的开发者来说,这意味着多了一条可选的推理加速路径;而对于普通用户,更值得关注的是上游是否会在后续版本中默认启用,或在 release notes 中补充具体的使用方法与性能数据。

信源