工具
DFlash 2 发布:支持 Qwen 3.8 27B 与 Muse Glimmer 的推测解码方案
DFlash 原作者推出第二版,提供 GGUF 量化与 llama.cpp 集成,面向本地推理加速。
2026.08.19 · 周三约 2 分钟阅读
DFlash 的原作者近日宣布推出 DFlash 2,并已开放对应模型的 GGUF 量化权重。现版本支持 Qwen 3.8 27B 与 Muse Glimmer 两个模型,同时已在 llama.cpp 项目提交了相关 PR,等待合并。这意味着本地推理用户可以在主流的 llama.cpp 推理框架中直接使用该推测解码方案。
关于 DFlash
DFlash 是一种面向大语言模型的推测解码(speculative decoding)加速方法,其核心思路是用一个轻量级的「草稿」模型来预先生成若干候选 token,再由目标模型一次性验证,从而在不改变输出分布的前提下提升推理吞吐。DFlash 2 作为该方法的迭代版本,由原作者团队直接发布。
当前可用资源
- 支持模型:Qwen 3.8 27B、Muse Glimmer。
- 权重格式:GGUF 量化版本已可在社区获取。
- 推理框架:llama.cpp 对应 PR 已提交,链接为 https://github.com/ggml-org/llama.cpp/pull/27342 。
信息局限
本次原始发布仅出现在 Reddit r/LocalLLaMA 板块,内容较为简短,未公开具体的速度提升倍数、显存占用变化或与原版 DFlash 的对比数据,也未公布完整的论文或技术报告。在缺少 benchmark 的情况下,DFlash 2 的实际加速效果与适用场景仍需等待后续测试与官方文档补充。
