桃子桃子快讯
返回首页
开源

Cursor 开源 MoE 训练内核 MoK,NVL72 速度提升 2.37 倍

Cursor 开源 MoE 训练内核 Mixture-of-Kittens,专为 NVIDIA NVL72 设计,速度达…

2026.08.05 · 周三2 分钟阅读

AI 代码编辑器公司 Cursor 在 X 平台宣布,开源其面向 NVIDIA NVL72 系统的 MoE(混合专家)训练 megakernel——Mixture-of-Kittens(简称 MoK)。该内核将 MoE 训练中的所有通信与计算操作融合进单一、完全确定性的内核中,实测速度较当前最强的公开基线最高快 2.37 倍。

核心设计:全融合的单一确定性内核

MoK 的核心思路是把 MoE 训练过程中分散的通信与计算整合到同一个 GPU 内核里执行,避免传统实现中多内核之间频繁同步与调度带来的额外开销。同时,该内核被设计为「完全确定性」(fully deterministic),即相同输入与硬件配置下每次运行的执行路径与结果完全一致,这对调试、性能回归测试以及大规模分布式训练的可复现性具有重要意义。

性能表现:最高 2.37 倍加速

根据 Cursor 公布的数据,MoK 在 NVL72 拓扑上的实测性能达到了「当前最强公开基线」的 2.37 倍。这意味着对于使用 NVL72 级硬件进行 MoE 模型训练的研究团队与工程团队而言,集成 MoK 可以在不改变模型结构与训练数据的前提下显著缩短训练时间或提升吞吐量。Cursor 同时在帖文中附上了开源仓库链接,供开发者自行复现与部署。

背景与行业意义

MoE 架构已成为当前主流大模型扩展模型容量的关键技术路径之一,但训练阶段高额的 all-to-all 通信开销一直是落地难点。MoK 这类针对特定硬件拓扑(NVL72)深度优化的训练内核,有助于进一步降低大规模 MoE 训练的成本与能耗,对于依赖开源训练栈的研究团队具有较高实用价值。

信源