桃子桃子快讯
返回首页
工具

RTX 5090 实测 Muse Glimmer 30B:DFlash 加速下推理达 253 t/s

社区用户在 RTX 5090 上测试 Muse Glimmer 30B 量化版,启用 DFlash 草案模型后代码生成速…

2026.08.11 · 周二3 分钟阅读

Reddit 用户 patricious 在 r/LocalLLaMA 板块分享了在 RTX 5090(32GB 显存)上运行 Muse Glimmer 30B UD-Q5_K_M 量化版本的实测结果。该模型配置 262k 上下文,配合 DFlash 草案模型与 mmproj 多模态投影,在代码生成负载下达到 220–253 tokens/s,较 llama.cpp 主线版本显著提速。

测试设置与对比数据

用户在 llama-server 中启用了多项优化:包括 speculative decoding(DFlash 草案模型)、统一 KV 缓存、mmap 加载模式以及针对 262k 上下文的 --override-kv 参数。其主要对比结果如下:

  • 代码生成(Code patch):主线 78 t/s → DFlash ngram-simple 57 t/s → DFlash 220–253 t/s
  • 混合 Agent 轮次:主线 77 t/s → ngram-simple 68 t/s → DFlash 188–213 t/s
  • 工具调用 JSON:主线 71 t/s → ngram-simple 75 t/s → DFlash 155–181 t/s
  • 深度推理(Heavy reasoning):主线 52 t/s → ngram-simple 58 t/s → DFlash 120–130 t/s

在代码生成场景下,启用 DFlash 后实测 253 t/s 与 Meta 公布的 233 t/s 基本吻合,而主线版本此前未能复现该数字。

关键补丁与注意事项

提速主要来自 PR #26842,该补丁将 DFlash 草案模型的 argmax 计算从 CPU 迁移到 GPU,消除了之前的瓶颈。用户将该 PR cherry-pick 到主线(分支在 Muse 合并前切出,仅需手动解决一处冲突)后即可正常构建。

需要注意的几点:

  • ngram-simple 在所有编程类负载上表现均逊于完整版 DFlash。
  • 服务端默认上下文长度受模型元数据限制,启用 262k 需手动设置 --override-kv
  • 该模板下推理预算(reasoning budget)标志不生效:实测将预算设为 64 时,模型仍消耗 2000+ 字符进行思考,且预算提示消息未出现,建议为推理块预留 max_tokens 余量。

适用人群与局限

该方案面向拥有 RTX 5090 级显存、希望在本地运行 30B 级多模态模型并追求高吞吐的开发者。PR #26842 目前仍为草案状态,作者建议自行承担风险,待其合入主线后建议重新基于主线构建,以获得后续稳定性修复。

信源