vLLM 团队创业公司 Inferact:TPU 跑 Kimi K3 比英伟达 GPU 快 57%
Inferact 用 megakernel 加 DSpark 在 16 块 TPU v7 上跑 Kimi K3 达 70…
由 vLLM 项目核心维护者创办的推理基础设施公司 Inferact,宣布在 16 块谷歌 TPU v7(Ironwood)上跑 Kimi K3 推理达到每秒 709 个 token,比同样数量英伟达 GB200 的 452 token/秒快了 57%。这一成绩的关键来自两项技术叠加:一是 Inferact 自研的 megakernel 推理内核,二是 DeepSeek 提出的 DSpark 推测解码框架。
同样芯片数量,TPU 跑出 57% 领先
Inferact 的对比测试在尽量一致的条件下进行:模型统一为 Kimi K3,推理引擎统一为 vLLM,唯一的变量是芯片与底层 kernel 实现。
- TPU v7:709 token/秒
- 英伟达 GB200:452 token/秒
这一差距不仅来自 DSpark 推测解码的贡献。Inferact 报告显示,其 TPU 上 acceptance length 达到 6,意味着每轮推测的 token 中平均有 6 个能通过大模型批量验证、单步解码耗时约 8.5 毫秒。
即便关掉推测解码,裸速对比依然明显:
- batch size = 1 时,TPU 249 token/秒,GB200 仅 127 token/秒;
- batch size = 8 时,TPU 865 token/秒,GB200 为 636 token/秒。
在 Qwen 3.8 27B 上差距进一步放大:4 块 TPU v7 跑出 1515 token/秒,同配置 GB200 仅 695 token/秒。Inferact 用 greedy decoding 验证显示,Kimi K3 在 TPU 上的 GPQA-Diamond 得分 94.4%、GSM8K 得分 97.2%,与 GPU 结果完全一致,没有精度损失。
为什么硬件带宽更高反而更慢
从硬件规格看,GB200 的 HBM 带宽为 8000 GB/s,TPU v7 为 7380 GB/s,带宽更大的 GPU 反而跑得更慢。Inferact 将原因归结为芯片上运行的软件层。
大模型推理的瓶颈不在计算,而在数据搬运:每生成一个 token,模型全部权重都要从 HBM 搬到片上缓存重算一次。传统做法将一次推理拆成几百个独立 kernel 顺序执行,kernel 之间的交接间隙会让内存带宽空转。CUDA Graphs 与英伟达 PDL 技术能缩短间隙,但 kernel 边界仍在。
Inferact 的做法是把整个模型推理「焊」成一个程序:
- Kimi K3 共有 92 层 MoE 计算,全部塞进一个 Pallas 程序,一次调用走完前向传播;
- 跨层权重预取得以实现,第 N 层算 MoE 时,第 N+1 层 attention 权重已开始搬入片上缓存;
- TPU v7 每个 Tensor Core 配有 64 MiB VMEM,生命周期由软件精确管理,可同时容纳当前层数据与下一层预取权重;
- 英伟达 Blackwell 片上内存分散在 152 个 SM 中、总量约 38 MiB,由硬件自动调度,跨层编排限制更多。
Inferact 用 Pallas 语言手写整个 megakernel,绕开 XLA 默认工具链——XLA 擅长优化单层,但 92 层跨层协调的分支太多,自动调度难以找到最优解。手写后编译时间从 XLA 的 30 分钟以上降至不到 90 秒,工程师改完一版 kernel 一分半钟即可上机验证。
目前 megakernel 针对 Kimi K3 的结构做了定制优化,换模型架构需重新适配;Inferact 表示后续将扩展到更多架构。
vLLM 原班人马的 1.5 亿美元种子轮
Inferact 成立于去年 11 月,团队几乎完全来自 vLLM 原始开发者阵容。CEO Simon Mo 是 vLLM 项目原始维护者,毕业于伯克利 EECS;联合创始人 Woosuk Kwon 是 vLLM 项目发起人,其提出的 PagedAttention 算法仍是 vLLM 的核心技术;首席科学家游凯超曾获清华大学特等奖学金,主导了 vLLM 的分布式推理功能开发。
公司今年完成 1.5 亿美元种子轮融资,估值 8 亿美元,由 a16z 与 Lightspeed 领投,真格、红杉、Altimeter 跟投。
这次的 TPU megakernel 来自 Inferact 与 Google Cloud 的联合工程合作,目标是把 TPU 打造为 vLLM 的一流支持平台,优化成果将回馈上游开源社区。「tpu-megakernels」代码仓库已作为首个公开成果放出。
