桃子桃子快讯
返回首页
开源

Netra Runtime 开源 AMD MI350X 推理 kernel,Qwen3.6-35B-A3B 8 卡达 7.8 万 tok/s

Netra Runtime 针对 AMD MI350X 优化 Qwen3.6-35B-A3B 推理 kernel,8 卡…

2026.08.26 · 周三2 分钟阅读

AMD 在 AI 推理领域长期被 NVIDIA 压制,ROCm 软件栈成熟度不足是主要原因之一。创业团队 Netra Runtime 最近拿到一批 AMD MI350X 后,从 kernel 层面对 Qwen3.6-35B-A3B 做了深度优化,并公布了与 vLLM 的对比数据,同时将 kernel 开源。

基准测试结果

根据 Netra Runtime 自述的测试数据:

  • 单卡 MI350X:11,161 output tok/s
  • 8 卡 MI350X:峰值 81,331 tok/s,均值 78,498.66 tok/s
  • 8 卡配置下,吞吐量约为 vLLM 的 2.16 倍

团队同时指出,MI350X 的原始算力在纸面上高于 NVIDIA B200,过去受限于软件栈而难以释放。

为何开源 kernel

Netra Runtime 选择了直接开源优化后的 kernel 以及相关组件,仓库地址为:

  • GitHub:github.com/NetraRuntime/netra-kernel
  • 配套技术博客:netraruntime.com/blog/qwen36-amd-mi350x-sglang-vllm-benchmark

团队表示,未来还会持续迭代,并透露了下一阶段的优化方向。

瓶颈已转移至调度与序列化

在 kernel 达到足够快的水平之后,剩余的性能瓶颈并不在算子本身。Netra Runtime 总结了观察到的新瓶颈:

  • 调度(scheduling)
  • 计算图覆盖率(graph coverage)
  • 循环状态(recurrent state)
  • 路由(routing)
  • HTTP 序列化

这意味着仅靠 kernel 优化已不足以继续压榨性能,后续需要在推理框架和服务端层面进一步改造。

小结

此次发布的开源 kernel 为 AMD MI350X 用户提供了一条现成的高吞吐推理路径,对希望摆脱 NVIDIA 绑定的团队具有一定参考价值。不过数据由 Netra Runtime 自测自述,尚未见第三方独立复现,读者在评估时应结合自身硬件与负载进行验证。

信源