桃子桃子快讯
返回首页
工具

NInfer 首发支持 Qwen3.8-27B:单卡 RTX 5090 达 200 tok/s

本地推理引擎 NInfer 宣布对 Qwen3.8-27B 提供 Day-0 支持,单卡 RTX 5090 可达约 20…

2026.08.15 · 周六2 分钟阅读

本地推理引擎 NInfer 宣布对 Qwen3.8-27B 提供 Day-0 支持,模型权重已托管在 Hugging Face(用户 neroued 的仓库)。在单张 RTX 5090 上,NInfer 结合投机解码(speculative decoding)仍可达到约 200 tok/s 的生成速度,适合希望在消费级硬件上跑 27B 级别模型的开发者尝鲜。

性能与硬件门槛

  • 单卡 RTX 5090 + 投机解码,生成速度约 200 tok/s。
  • 强调「Day-0 支持」,即模型发布即可跑通,以减少用户等待适配的时间。

并发与缓存改进

相较上一版本,NInfer 在以下方面做了升级:

  • 支持最多 8 个并发请求,同时维持全上下文长度使用。
  • 引入共享分页 KV 缓存池(shared paged KV cache pool),降低多请求下的显存占用。
  • 实现 ReplaySSM,用于 GDN(线性注意力)+ 投机解码组合,显著降低并发场景下的循环状态内存开销,作者称这是 vLLM 尚未完整体验的能力。
  • 进行了多项 CUDA kernel 优化,并启用 PDL(Programmatic Dependent Launch)进一步压缩延迟。

体验与反馈渠道

  • 用户只需更新 NInfer 源码至最新版本即可使用。
  • 作者在 Reddit r/LocalLLaMA 接受反馈和 bug 报告,并承诺尽快修复。

注意事项

  • Qwen3.8-27B 并非阿里通义官方正式发布的 Qwen3 系列版本,仓库所有权为社区用户 neroued,更像是社区微调或再分发版本,读者在选用前应自行核实权重来源与许可。
  • NInfer 仍是较早期的社区推理引擎,覆盖度与稳定性距 vLLM、TensorRT-LLM 等主流方案仍有差距,建议生产环境先做充分测试。
信源