开源
Qwen3.6-27B 推测解码横评:DFlash 领先,EAGLE3 在 vLLM 报错
社区用户在单卡 RTX PRO 6000 Max-Q 上对 Qwen3.6-27B 的四种推测解码方法进行基准测试,DF…
2026.07.21 · 周二约 2 分钟阅读
近日,Reddit 用户 thavoc77 在 r/LocalLLaMA 发布了一组针对 Qwen3.6-27B(dense,NVFP4 量化)模型的推测解码(speculative decoding)横评结果。该测试在单张 RTX PRO 6000 Max-Q 上完成,对比了 vLLM 与 SGLang 两个推理框架下 MTP、DFlash、EAGLE3 和 ngram 四种方法的加速表现。
测试方法
为保证结果可比,作者在所有引擎上使用同一固定客户端,每个测试点取 3 次重启样本取平均。基准为 Spec-Bench,greedy 解码,batch 1,结果按 6 个类别取平均。加速比以各引擎自身的非推测解码基线为参照。
加速效果排名
- DFlash:综合表现最佳,SGLang 上约 3.3 倍加速,vLLM 上约 2.5 倍;在 math_reasoning 类别单独可达 4.6 倍。
- MTP / NEXTN:约 2.2–2.8 倍加速,且随 draft depth 增加持续上升。
- EAGLE3:约 1.9 倍加速,在 K=3 后趋于平稳,曲线形态与 NEXTN 完全相反。
- ngram:仅 1.1–1.3 倍加速,收益有限。
发现的两个工程问题
作者额外花费了一整晚排查两个非预期问题:
- EAGLE3 在 vLLM 上完全无法加载该模型,hf_hub 的 head_dim 校验拒绝当前 head 维度;仅 SGLang 可用,且需要使用打了补丁的构建版本。
- DFlash 在 SGLang 上首个 token 会崩溃。原因是 DFlash 的 sampler 对 lm_head 做原始 matmul,而 NVIDIA NVFP4 checkpoint 对该层做了量化,导致 shape 报错。通过一次性反量化 head 的约 15 行补丁可修复;同时需限制 max-running-requests,否则 mamba/GDN 缓存会 OOM 杀掉进程池。
实践建议
对于在 Qwen3.6-27B NVFP4 量化版本上做本地推理的用户,DFlash 是当前收益最明显的方案,但需手动打补丁;EAGLE3 仅在 SGLang 修补版本上可用;ngram 收益过小,不建议作为主选。
