工具
RTX 5090 实测 Muse Glimmer 30B:DFlash 加速下推理达 253 t/s
社区用户在 RTX 5090 上测试 Muse Glimmer 30B 量化版,启用 DFlash 草案模型后代码生成速…
2026.08.11 · 周二约 3 分钟阅读
Reddit 用户 patricious 在 r/LocalLLaMA 板块分享了在 RTX 5090(32GB 显存)上运行 Muse Glimmer 30B UD-Q5_K_M 量化版本的实测结果。该模型配置 262k 上下文,配合 DFlash 草案模型与 mmproj 多模态投影,在代码生成负载下达到 220–253 tokens/s,较 llama.cpp 主线版本显著提速。
测试设置与对比数据
用户在 llama-server 中启用了多项优化:包括 speculative decoding(DFlash 草案模型)、统一 KV 缓存、mmap 加载模式以及针对 262k 上下文的 --override-kv 参数。其主要对比结果如下:
- 代码生成(Code patch):主线 78 t/s → DFlash ngram-simple 57 t/s → DFlash 220–253 t/s
- 混合 Agent 轮次:主线 77 t/s → ngram-simple 68 t/s → DFlash 188–213 t/s
- 工具调用 JSON:主线 71 t/s → ngram-simple 75 t/s → DFlash 155–181 t/s
- 深度推理(Heavy reasoning):主线 52 t/s → ngram-simple 58 t/s → DFlash 120–130 t/s
在代码生成场景下,启用 DFlash 后实测 253 t/s 与 Meta 公布的 233 t/s 基本吻合,而主线版本此前未能复现该数字。
关键补丁与注意事项
提速主要来自 PR #26842,该补丁将 DFlash 草案模型的 argmax 计算从 CPU 迁移到 GPU,消除了之前的瓶颈。用户将该 PR cherry-pick 到主线(分支在 Muse 合并前切出,仅需手动解决一处冲突)后即可正常构建。
需要注意的几点:
- ngram-simple 在所有编程类负载上表现均逊于完整版 DFlash。
- 服务端默认上下文长度受模型元数据限制,启用 262k 需手动设置
--override-kv。 - 该模板下推理预算(reasoning budget)标志不生效:实测将预算设为 64 时,模型仍消耗 2000+ 字符进行思考,且预算提示消息未出现,建议为推理块预留
max_tokens余量。
适用人群与局限
该方案面向拥有 RTX 5090 级显存、希望在本地运行 30B 级多模态模型并追求高吞吐的开发者。PR #26842 目前仍为草案状态,作者建议自行承担风险,待其合入主线后建议重新基于主线构建,以获得后续稳定性修复。
