MTP 加速现已可用于 GLM-4.5-Air
llama.cpp 新增对 GLM-4.5-Air 的 MTP 多 token 预测支持,106B MoE 仅激活 12…
GLM-4.5-Air 是智谱去年开源的 MoE 大模型,总参数量为 106B,但每次推理仅激活约 12B 参数。近日,llama.cpp 已合并对该模型的 MTP(Multi-Token Prediction,多 token 预测)支持,本地部署用户可在不显著增加显存占用的前提下获得明显的生成速度提升。
模型规格与 MTP 加速原理
GLM-4.5-Air 采用混合专家架构,总参数量达 106B,但每个 token 仅激活约 12B 参数。这一设计意味着模型对显存容量较为敏感,但对单次推理的算力需求相对克制。MTP 通过在每一步并行预测多个后续 token 来提高推理吞吐量,在 llama.cpp 中启用后,对于长文本生成与对话场景尤为受益。
适用硬件与典型部署场景
MTP 加速特别适合「显存充裕但算力受限」的设备,包括:
- AMD Strix Halo(锐龙 AI Max 系列)
- NVIDIA DGX Spark
- 由多张 RTX 3090 组成的本地工作站
帖子作者本人在多卡 3090 环境下做了实测,反馈称其在创意写作场景下效果出色,尤其考虑到 Gemma 4 124B MoE 至今未能面世,GLM-4.5-Air 在本地创意写作领域仍具吸引力。
社区资源与微调模型
Hugging Face 上已存在多个基于 GLM-4.5-Air 的创意写作、角色扮演方向的微调版本,部分发布于今年,作者也推荐 PrimeIntellect 的 Intellect 3.x 系列。如果本地已有的 GGUF 量化文件未附带 MTP 模块,可单独下载社区提供的 MTP 附加文件补齐功能。
本次 llama.cpp 的 MTP 支持由社区开发者 devMiikaK 与 HeadCutter 在 PR 阶段参与测试,原帖作者 jacek2023 对此表示感谢。帖子末尾补充说明,同样的 MTP 支持同样适用于完整版的 GLM-4.5,不过作者笑言「怀疑是否还有人在用完整版」。
