DFlash2 推测解码加速 Qwen3 实测:推理速度最高提升约 3 倍
llama.cpp 合并 DFlash2 推测解码方案,社区在 RTX 6000 上对 Qwen3 模型实测,速度约为基…
llama.cpp 近期合并的 PR #27342 引入了名为 DFlash2 的新型推测解码(speculative decoding)方案。Reddit 用户在 RTX 6000 显卡上针对 Qwen3 系列模型(原文标注 qwen3.8 27B)进行了四组解码方式的横向实测,涵盖 baseline、MTP、DFlash 与 DFlash2 四种配置。
实测加速效果
测试选取四类任务,以四组结果的中位数作为对比口径,单位为 tokens/second(tok/s):
- baseline:47.4 tok/s
- MTP(Multi-Token Prediction):114.7 tok/s
- DFlash(v1):99.3 tok/s
- DFlash2:140.6 tok/s
从基线到 DFlash2,整体约为 3 倍加速;但作者强调加速比高度依赖任务类型,其中一项测试仅取得约 1.5 倍提升,说明 DFlash2 并非在所有场景下都能稳定获得理论峰值。
关于 DFlash2 的技术背景
DFlash2 由 inco.ai 提出,详细技术说明可参考其官方博客。DFlash2 属于推测解码的一种演进形态,与 MTP、传统 DFlash 思路相近,但通过改进候选 token 的生成与验证机制,在同等硬件下获得更高的吞吐。推测解码的核心思想是用一个轻量级「草稿」模型(或同模型的近似路径)先快速生成若干候选 token,再由目标模型一次性验证,从而摊销每一步解码的前向计算开销。
社区意义与局限
本次测试来自 atomic.chat 团队成员,该团队同时在 Hugging Face 上发布量化权重并提供本地运行模型的桌面与移动应用。从实用角度看:
- 对本地部署 Qwen3 系列模型的用户而言,DFlash2 提供了一条无需更换模型即可获得显著速度提升的路径;
- 加速效果随任务差异较大,实际部署时仍需结合自身 workload 评估;
- 该方案已合入 llama.cpp 主干,后续随版本升级即可直接使用。
需要指出的是,原文标注的模型名称「qwen3.8 27B」存在歧义,可能指 Qwen3-8B 或 Qwen3-27B,社区测试的精确配置未在帖子中详细披露,读者若需复现可参考 DFlash2 官方博客与 llama.cpp PR #27342 的说明。
