行业动态
Together AI 提前适配 NVIDIA Rubin:基于 B200 逐步加入新硬件特性
Together AI 在 X 上披露,已基于 B200 GEMM kernel 逐步加入 NVIDIA Rubin 新…
2026.09.11 · 周五约 2 分钟阅读
AI 推理云厂商 Together AI 在 X 平台透露,其工程团队已获得 NVIDIA 的早期支持,开始为下一代 Rubin 架构 GPU 编写底层计算 kernel。团队以现有的 B200(Blackwell)GEMM kernel 为起点,逐步叠加 Rubin 引入的新硬件特性,目前仍处于早期验证阶段。
从 B200 GEMM 出发,逐步叠加 Rubin 新特性
Together AI 表示,工作流从他们此前在 B200 上自研的 GEMM(通用矩阵乘法)kernel 开始,再分阶段为 Rubin 加入该架构特有的功能,包括:
- 更宽的 MMA(Matrix Multiply-Accumulate)步幅,以匹配 Rubin 扩大的 tensor core 吞吐;
- 更多的 tensor 寄存器与 shared memory 配置,覆盖更大规模的矩阵运算;
- B-side collectors 等与数据通路相关的新原语;
- 与 Rubin 早期 A 步进(early A release)硬件相对应的兼容性调整。
后续路线:LUT GEMM、硬件原生 Megakernel 与引擎优化
官方明确表示,当前发布的 kernel 仍属早期版本,接下来计划推进的方向包括:
- LUT(查找表)GEMM kernel;
- 硬件原生的 megakernel 设计;
- 针对新引擎的进一步性能优化。
Together AI 在文末特别致谢 NVIDIA 提供早期硬件访问与技术支持,间接印证 Rubin 平台已进入对核心合作伙伴的早期分发阶段。
行业含义
虽然这条动态本身信息密度有限,但它释放了一个明确信号:NVIDIA Rubin 已开始进入头部 AI 云的早期适配周期。Together AI 作为重要的大模型推理服务商,提前介入 kernel 层优化,意味着 Rubin 的软件生态布局正在悄然推进,对后续模型训练与推理的硬件选型、性能上限具备参考意义。
