推测解码:本地大模型的免费加速开关
解析推测解码原理与研究数据,记录 Qwen 3.6、Gemma 4 等模型在 2026 年原生集成 MTP 推测解码的行…
推测解码(speculative decoding)是一项长期存在于学术论文中、却在 2026 年才真正进入本地大模型工具链的推理加速技术。它借助一个小型「草稿模型」提前猜测后续若干 token,再由主模型在一次并行前向中批量验证,从而把受限于显存带宽的串行 token 生成,转化为接近 prompt 处理的并行工作负载。值得注意的是,整个过程在数学上是无损的:验证阶段采用拒绝采样规则,输出分布与主模型单独推理完全一致,用户不会看到任何回答内容的改变,付出的代价仅是额外的 VRAM 与少量计算。
原理:把串行生成变成并行验证
大模型 token 生成受显存带宽而非算力限制,这一点在 prompt 处理时表现尤为明显:同样的硬件,处理 prompt 可达 800+ token/s,而逐 token 生成往往只有 20 token/s 左右。推测解码的核心思路是:让一个同词表的小模型连续猜测 K 个 token,主模型在一次前向中并行检查这些候选;命中部分直接采纳,第一个分歧点丢弃草稿并采用主模型自己的输出。由于主模型的算力在一次并行调用里被充分利用,原本空闲的 GPU 终于有事可做。LM Studio 与 llama.cpp 都内置了这一机制,启用后会实时显示「接受率」指标——这是判断配置是否合理的首要依据。
学术成果:1.5–3.5 倍加速
多项研究给出了具体数据:
- Leviathan 等(Google,2022):在 T5X 上用独立草稿模型实现 2–3 倍加速。
- Chen 等(DeepMind,2023):在 Chinchilla 70B 上用改进的拒绝采样达到 2–2.5 倍。
- Medusa(Cai 等,2024):在模型本身上加解码头,无需独立草稿,加速 2.2–3.6 倍。
- EAGLE(Li 等,2024):读取主模型隐状态的小型 drafter,在 Llama 2 70B 上实现 2.7–3.5 倍。
上述数据来自数据中心硬件。本地环境的实际收益通常要打折扣,1.5–2 倍是较为现实的预期。决定加速效果的关键变量是接受率:草稿与主模型一致率达到 70–80% 时接近翻倍,低于 50% 时收益会被草稿开销抵消。
2026 年拐点:MTP 让推测解码「开箱即用」
过去用户需要自行寻找「同家族」的草稿模型,门槛较高。2024 年 DeepSeek-V3 技术报告提出的多 token 预测(MTP)目标函数改变了这一局面:模型在训练阶段就内建了小型草稿头,无需外部 draft。2026 年这一思路进入消费级产品:
- Qwen 3.6 内置 MTP 层,llama.cpp 已通过
--spec-type mtp参数支持;有用户在 M2 Max 96GB 上跑 Qwen 3.6 27B 报告了 2.5 倍加速,达到 28 token/s。 - Gemma 4 在 2026 年 5 月为全系尺寸发布了官方 MTP drafter checkpoint,最小一款仅 7800 万参数,面向手机端 E2B 模型;Google 宣称最高 3 倍加速且保证与标准生成「完全一致的质量」,Ollama、vLLM、SGLang、MLX 均已支持。
- Ollama 终于合入长期悬而未决的推测解码支持请求,通过 Modelfile 中的 DRAFT 命令启用 Gemma 4 的 MTP 草稿。
正如 r/LocalLLaMA 上一位用户总结的:MTP 是推测解码的一种实现形式——传统方式用独立草稿模型,MTP 则把额外的输出头挂在主模型上,复用主模型状态。数学原理相同,草稿匹配度更好,部署门槛归零。
实战配置:从 llama.cpp 到 LM Studio
不同运行时的启用方式如下:
- LM Studio:加载主模型后,在 Speculative Decoding 面板选择同家族草稿(如 Qwen 2.5 14B + Qwen 2.5 0.5B),界面实时显示接受 token 统计。
- llama.cpp 经典草稿模式:
llama-server -m big.gguf --model-draft small.gguf --spec-draft-n-max 3,要求主草稿模型使用相同 tokenizer。 - llama.cpp MTP 模式:在已转换为 GGUF 的 MTP 模型(如 Qwen 3.6、Gemma 4)上使用
--spec-type mtp --spec-draft-n-max 3。 - llama.cpp 无草稿模式:
--spec-type ngram-mod通过模式匹配复用近期 token 作为草稿,零额外 VRAM,可在任意模型上启用,对长上下文场景帮助较大。
实操上有两条经验法则:草稿模型应与主模型同家族(Qwen 配 Qwen、Llama 配 Llama),尺寸最好控制在主模型的十分之一以内,LM Studio 推荐的配对是 8B 主模型搭配 1B 草稿、32B 主模型搭配不超过 1.5B 草稿。更大的草稿猜测更准,但每次猜测的开销也随之上升,边际收益迅速递减。
