工具
NInfer 首发支持 Qwen3.8-27B:单卡 RTX 5090 达 200 tok/s
本地推理引擎 NInfer 宣布对 Qwen3.8-27B 提供 Day-0 支持,单卡 RTX 5090 可达约 20…
2026.08.15 · 周六约 2 分钟阅读
本地推理引擎 NInfer 宣布对 Qwen3.8-27B 提供 Day-0 支持,模型权重已托管在 Hugging Face(用户 neroued 的仓库)。在单张 RTX 5090 上,NInfer 结合投机解码(speculative decoding)仍可达到约 200 tok/s 的生成速度,适合希望在消费级硬件上跑 27B 级别模型的开发者尝鲜。
性能与硬件门槛
- 单卡 RTX 5090 + 投机解码,生成速度约 200 tok/s。
- 强调「Day-0 支持」,即模型发布即可跑通,以减少用户等待适配的时间。
并发与缓存改进
相较上一版本,NInfer 在以下方面做了升级:
- 支持最多 8 个并发请求,同时维持全上下文长度使用。
- 引入共享分页 KV 缓存池(shared paged KV cache pool),降低多请求下的显存占用。
- 实现 ReplaySSM,用于 GDN(线性注意力)+ 投机解码组合,显著降低并发场景下的循环状态内存开销,作者称这是 vLLM 尚未完整体验的能力。
- 进行了多项 CUDA kernel 优化,并启用 PDL(Programmatic Dependent Launch)进一步压缩延迟。
体验与反馈渠道
- 用户只需更新 NInfer 源码至最新版本即可使用。
- 作者在 Reddit r/LocalLLaMA 接受反馈和 bug 报告,并承诺尽快修复。
注意事项
- Qwen3.8-27B 并非阿里通义官方正式发布的 Qwen3 系列版本,仓库所有权为社区用户 neroued,更像是社区微调或再分发版本,读者在选用前应自行核实权重来源与许可。
- NInfer 仍是较早期的社区推理引擎,覆盖度与稳定性距 vLLM、TensorRT-LLM 等主流方案仍有差距,建议生产环境先做充分测试。
