工具
社区推出 RTX 5090 专用推理引擎,单实例可达 720 token/s
GitHub 用户 Neroued 开源 ninfer 推理引擎,专为 RTX 5090 优化,单实例运行 Qwen 3…
2026.07.28 · 周二约 2 分钟阅读
近日,GitHub 用户 Neroued 开源了一款名为 ninfer 的本地大模型推理引擎,针对 NVIDIA RTX 5090 显卡做深度定制。根据作者在 Reddit r/LocalLLaMA 社区的分享,该工具在单实例条件下运行 Qwen 35B 模型时,可达到约 550–720 token/s 的生成速度,默认使用「无思考」(No thinking)模式以追求极致吞吐,并支持完整的 25 万 token 上下文窗口。
性能表现
作者实测数据显示,ninfer 在 RTX 5090 上的单实例推理速度区间为 550–720 token/s,具体数值随任务类型波动。作者特别指出,此前要在消费级硬件上达到类似水平,通常需要批处理或多智能体并行才能实现,而 ninfer 在单实例下即可达成。作者在原帖中将这一速度形容为「接近 Cerebras」水平。
硬件与模型适配
ninfer 当前专为 RTX 5090 设计,官方仓库仅提供 Linux 构建版本,作者表示 Windows 用户可通过第三方代码生成工具自行编译运行。引擎目前仅支持两款模型,分别为 Qwen 27B 与 Qwen 35B 变体。作者强调,该项目是为 RTX 5090 的特定硬件特性「目的性构建」,因此其他显卡型号不在官方支持范围内。
局限与现状
需要指出的是,该项目仍处于早期阶段,存在以下明显局限:
- 速度数据来源于作者单方面实测,未公开标准化 benchmark 结果
- 仅适配 RTX 5090,其他显卡未经作者验证
- 模型支持范围有限,仅两款 Qwen 变体
- 暂无官方 Windows 构建,需用户自行编译
- 缺乏系统化的技术文档,仓库尚处于早期
项目仓库地址为 github.com/Neroued/ninfer,目前仅面向 Linux 平台。由于暂无第三方独立验证,建议读者结合自身硬件配置理性参考上述速度数据。
