研究论文
Qwen3.6-27B 投机解码跨量化基准测试:DFlash 综合最快
社区用户完成 Qwen3.6-27B 在不同量化下的投机解码基准,DFlash 综合领先,量化越重收益越大。
2026.07.27 · 周一约 3 分钟阅读
一位 Reddit 用户(u/thavoc77)近日完成了 Qwen3.6-27B 跨量化级别(Q8、Q6、Q4、nvfp4)的投机解码(speculative decoding)速度基准测试,并在 r/LocalLLaMA 公开了算法配方、补丁与版本信息。报告指出,量化越重,投机解码带来的加速倍数越高;DFlash 是综合表现最优的算法,Weaver 虽在个别组合上超过 DFlash,但仅作为「fork-only」特例存在,并非通用选项。
核心结论
- 量化越重,投机解码收益越大:在 10 组投机解码配置中,加速倍数均按 Q8 > Q6 > Q4 排序。
- 接受率与量化无关:在匹配的草稿深度下,接受率表现一致;基础 step 速度随权重字节数增加而变慢,草稿 + 校验开销则不受量化影响。
- 最快组合:nvfp4 量化 + SGLang 引擎是整体最快的量化 / 引擎组合。
算法对比
- DFlash:综合最快,是目前最具普适性的选择。
- MTP:在所有场景下稳居第二,是可靠的默认备选。
- Weaver:仅在 fork 场景且针对特定目标模型时跑赢 DFlash,属于个例而非通用方案。
- EAGLE3:被 DFlash 与 MTP 双双重压,仅在没有 DFlash 草稿器时作为兜底。
- ngram:所有量化下仅约 1.03 倍加速,并发场景下甚至净负收益,作者建议直接跳过。
异常发现
llama.cpp 的 MTP 路径在 UD-Q4 上出现病态慢速:Q4 MTP-3 在绝对 tok/s 上慢于 Q6 MTP-3,但接受率相同,单纯带宽无法解释该现象。输出结果正确,但具体机理暂不明确。
局限与说明
作者强调,本次数据仅基于单一硬件配置的窄样本,测试采用 Spec-BBench、短输出、贪心解码、batch 1,接近投机解码的最佳工作负载。在并发场景下,单流的收益会下降,长上下文会进一步压缩该收益,因此结论应视为该工作负载形态下的上限,而非通用加速比。此外,本次测试尚未做精度 A/B 对比,更重的量化所保留的质量优势是否值得剩余的速度差距,仍未可知。
参考资料
- 配方、补丁与版本:https://gist.github.com/thavoc/a9f3a37c082e7a8bbcf2b8efebfada25
- 原帖讨论:Reddit r/LocalLLaMA
