工具
Together AI:ThunderKittens 算子已跑通 NVIDIA Vera Rubin
Together AI 团队提前拿到 Vera Rubin NVL72 适配硬件,ThunderKittens 算子经重…
2026.09.11 · 周五约 2 分钟阅读
Together AI 近日在 X 平台宣布,其 GPU 算子库 ThunderKittens 已成功运行在 NVIDIA 新一代 Vera Rubin 架构之上。Together AI 的算子团队提前获得了 NVL72 节点的访问权限,并花数天时间梳理新 ISA,针对 Rubin 重写了已有算子。
适配进展与实测数据
经过对 Rubin 新指令集与硬件特性的适配,ThunderKittens 团队将 NVFP4 与 FP8 两种精度的 GEMM(通用矩阵乘)算子重新落地,实测性能如下:
- NVFP4 GEMM:超过 22 PFLOPS
- FP8 GEMM:超过 12 PFLOPS
官方表示,上述成绩与 NVIDIA 自家的 cuBLAS 配合 CuTe DSL 写出的版本相比具备竞争力,意味着开源/第三方算子在下一代硬件上已经可以接近厂商官方最优实现。
关于 ThunderKittens 与 Vera Rubin
ThunderKittens 是一套面向现代 GPU(以 NVIDIA Hopper/Blackwell 为起点)的高效张量算子框架,主打轻量、易读与高性能,长期被用于训练和推理场景的定制 kernel 编写。Vera Rubin 则是 NVIDIA 继 Blackwell 之后的下一代数据中心 GPU 架构,NVL72 是其机柜级互联形态,强调高密度 NVLink 互联与更强张量性能。
Together AI 选择在 Rubin 正式量产前提前适配,既是为后续大模型训练/推理负载铺路,也是对自有算子栈的提前验证。
局限与待观察
- 公开信息仅为一条 X 推文,缺少完整 benchmark 设置、显存占用、功耗与对比条件;
- 未给出与 cuBLAS + CuTe DSL 的逐项对比数据,「competitive」的具体幅度有待复现;
- Vera Rubin 的正式供货时间与 ThunderKittens 上游 PR 合并节奏尚未披露。
对关注 GPU 内核生态与下一代 AI 算力平台的开发者而言,这是一次值得跟进但仍需更多细节佐证的早期信号。
