桃子桃子快讯
返回首页
工具

Ornith-397B 单卡部署实测:Q4 量化下预填充超 2,300 tok/s

Krasis 运行时在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 量化运行 Ornith-…

2026.07.27 · 周一3 分钟阅读

开发者在 Reddit r/LocalLLaMA 板块分享了自研 MoE 推理运行时 Krasis 在单张 NVIDIA RTX PRO 6000 Blackwell 96GB 上运行 Ornith-1.0-397B 的实测结果。该方案通过 CPU 内存扩展显存容量、动态调度驻留专家,使 397B 级别模型在工作站级硬件上达到可交互的生成速度。

硬件与运行方式

测试平台为 1 张 RTX PRO 6000 Blackwell 96GB 加 AMD EPYC 7742 64 核处理器,系统 DDR4 内存需足以在 Q4 精度下容纳模型权重。397B 参数的模型显然无法整体放入 96GB 显存,因此 Krasis 将专家权重保留在 CPU 内存中,仅动态管理一部分专家常驻显存。本次运行约有 43% 的路由专家常驻显存,进程峰值内存约 202 GB,因此最低需要 256 GB DDR5 内存(消费级主板即可达成)。

实测性能数据

量化与注意力配置为 INT4 专家权重、HQQ4 注意力、4-bit KV 缓存,关键数据如下:

  • 10,000 tokens 预填充:1,346.3 tok/s,耗时 7.43 秒
  • 39,920 tokens 预填充:2,354.5 tok/s,耗时 16.95 秒
  • 50 tokens 解码:23.58 tok/s
  • 100 tokens 解码:21.85 tok/s
  • 250 tokens 持续解码:20.40 tok/s
  • 启用 Krasis 自适应冷质量剪枝后,50 tokens 解码提升至 25.73 tok/s(+9.1%)

自适应冷质量剪枝

开发者展示了 Krasis 的 Adaptive Cold Mass Pruning 优化:在实测运行中跳过低排名、非驻留专家路由,平均仅省略约 1.8% 的路由概率分布,便带来约 9.1% 的解码速度提升。该机制在保持模型质量损失极小的前提下,进一步压低解码延迟。

其他部署场景

  • 当模型可整体放入系统内存时,较小 MoE 模型速度明显更快,例如 35B 级别在 RTX 5090 上可达约 117 tok/s 解码。
  • Ornith-397B 同样可在单张 RTX 5090 32GB 上运行,速度约 7.9 tok/s,可作为低显存方案的参考。

小结

Krasis 的核心思路是用 CPU 内存弥补显存不足,并以动态专家调度让大模型在单卡场景下达到可用速度。对希望本地部署 397B 级别 MoE 模型的研究者与爱好者来说,这条路径对硬件门槛相对友好,但需要大容量系统内存与较新型号的 GPU 配合。开发者同时公开了 GitHub 仓库以及速度与质量基准链接,便于复现与验证。

信源