开源
Netra Runtime 开源 AMD MI350X 推理 kernel,Qwen3.6-35B-A3B 8 卡达 7.8 万 tok/s
Netra Runtime 针对 AMD MI350X 优化 Qwen3.6-35B-A3B 推理 kernel,8 卡…
2026.08.26 · 周三约 2 分钟阅读
AMD 在 AI 推理领域长期被 NVIDIA 压制,ROCm 软件栈成熟度不足是主要原因之一。创业团队 Netra Runtime 最近拿到一批 AMD MI350X 后,从 kernel 层面对 Qwen3.6-35B-A3B 做了深度优化,并公布了与 vLLM 的对比数据,同时将 kernel 开源。
基准测试结果
根据 Netra Runtime 自述的测试数据:
- 单卡 MI350X:11,161 output tok/s
- 8 卡 MI350X:峰值 81,331 tok/s,均值 78,498.66 tok/s
- 8 卡配置下,吞吐量约为 vLLM 的 2.16 倍
团队同时指出,MI350X 的原始算力在纸面上高于 NVIDIA B200,过去受限于软件栈而难以释放。
为何开源 kernel
Netra Runtime 选择了直接开源优化后的 kernel 以及相关组件,仓库地址为:
- GitHub:github.com/NetraRuntime/netra-kernel
- 配套技术博客:netraruntime.com/blog/qwen36-amd-mi350x-sglang-vllm-benchmark
团队表示,未来还会持续迭代,并透露了下一阶段的优化方向。
瓶颈已转移至调度与序列化
在 kernel 达到足够快的水平之后,剩余的性能瓶颈并不在算子本身。Netra Runtime 总结了观察到的新瓶颈:
- 调度(scheduling)
- 计算图覆盖率(graph coverage)
- 循环状态(recurrent state)
- 路由(routing)
- HTTP 序列化
这意味着仅靠 kernel 优化已不足以继续压榨性能,后续需要在推理框架和服务端层面进一步改造。
小结
此次发布的开源 kernel 为 AMD MI350X 用户提供了一条现成的高吞吐推理路径,对希望摆脱 NVIDIA 绑定的团队具有一定参考价值。不过数据由 Netra Runtime 自测自述,尚未见第三方独立复现,读者在评估时应结合自身硬件与负载进行验证。
