桃子桃子快讯
返回首页
行业动态

Together AI 提前适配 NVIDIA Rubin:基于 B200 逐步加入新硬件特性

Together AI 在 X 上披露,已基于 B200 GEMM kernel 逐步加入 NVIDIA Rubin 新…

2026.09.11 · 周五2 分钟阅读

AI 推理云厂商 Together AI 在 X 平台透露,其工程团队已获得 NVIDIA 的早期支持,开始为下一代 Rubin 架构 GPU 编写底层计算 kernel。团队以现有的 B200(Blackwell)GEMM kernel 为起点,逐步叠加 Rubin 引入的新硬件特性,目前仍处于早期验证阶段。

从 B200 GEMM 出发,逐步叠加 Rubin 新特性

Together AI 表示,工作流从他们此前在 B200 上自研的 GEMM(通用矩阵乘法)kernel 开始,再分阶段为 Rubin 加入该架构特有的功能,包括:

  • 更宽的 MMA(Matrix Multiply-Accumulate)步幅,以匹配 Rubin 扩大的 tensor core 吞吐;
  • 更多的 tensor 寄存器与 shared memory 配置,覆盖更大规模的矩阵运算;
  • B-side collectors 等与数据通路相关的新原语;
  • 与 Rubin 早期 A 步进(early A release)硬件相对应的兼容性调整。

后续路线:LUT GEMM、硬件原生 Megakernel 与引擎优化

官方明确表示,当前发布的 kernel 仍属早期版本,接下来计划推进的方向包括:

  • LUT(查找表)GEMM kernel;
  • 硬件原生的 megakernel 设计;
  • 针对新引擎的进一步性能优化。

Together AI 在文末特别致谢 NVIDIA 提供早期硬件访问与技术支持,间接印证 Rubin 平台已进入对核心合作伙伴的早期分发阶段。

行业含义

虽然这条动态本身信息密度有限,但它释放了一个明确信号:NVIDIA Rubin 已开始进入头部 AI 云的早期适配周期。Together AI 作为重要的大模型推理服务商,提前介入 kernel 层优化,意味着 Rubin 的软件生态布局正在悄然推进,对后续模型训练与推理的硬件选型、性能上限具备参考意义。

信源