工具
llama.cpp 合并 DSpark 推测解码 支持 DeepSeek 系列加速推理
llama.cpp 提交 PR #25173 引入 DSpark 推测解码实现,社区开始测试 DeepSeek-V4 等…
2026.07.28 · 周二约 2 分钟阅读
llama.cpp 项目近期合并了一项关于推测解码(speculative decoding)的实验性实现 DSpark,相关讨论已在 r/LocalLLaMA 板块引发关注。推测解码是一种通过小型草稿模型预生成候选 token、再由主模型并行验证的推理加速技术,能够在不损失输出质量的前提下显著提升 token 生成速度。
什么是 DSpark
DSpark 是由社区贡献者 wjinxu 提交的 PR(#25173)所引入的推测解码方案。在 llama.cpp 中启用该方案后,用户可在本地推理时获得明显的 prompt processing(pp)与 text generation(tg)速度提升。目前 PR 已进入可实验状态,开发者邀请社区成员在不同硬件与模型组合下进行基准测试并分享结果。
与 DeepSeek 模型的关联
社区围绕 DSpark 已整理出一组相关资源,方便用户直接试用:
- DeepSpec:DeepSeek 官方发布的推测解码相关模型集合。
- DeepSeek-V4 DSpark 变体:包含 DeepSeek-V4-Pro-DSpark 等针对推测解码优化的版本。
- Bonsai AntiDoom 1bit DSpark:Hugging Face 上由社区上传的 Bonsai-27B-antidoom-1bit-DSpark 模型,面向极端量化场景。
这些模型与 DSpark 搭配使用,可以在消费级显卡上获得更可观的推理吞吐。
当前状态与社区期待
由于 PR 仍处于早期实验阶段,官方尚未公布详细的性能基准。社区讨论重点集中在不同量化精度(尤其是 1bit、2bit 等低位宽场景)下 DSpark 的实际加速比,以及与现有 llama.cpp 默认解码路径的兼容性表现。对于关注本地大模型推理效率的开发者而言,DSpark 提供了一条值得跟踪的优化路径。
