月之暗面核心科学家苏剑林:Kimi K3 背后的关键先生
苏剑林从 RoPE 到 AttnRes,长期参与 Kimi 关键技术研发,是 K2、K3 训练背后的核心架构师。
作为月之暗面(Kimi)核心架构师之一,苏剑林从 RoPE 到 Attention Residuals 的技术轨迹,几乎覆盖了 Kimi 近几代模型的关键技术节点。36 氪经授权转载的「The AI Outlook」人物特稿,勾勒出这位被同事称为「苏神」的科学家在 Kimi K3 研发中的真实角色。
从 RoPE 到 Transformer 基础组件贡献者
苏剑林 1993 年生于广东云浮,本科就读于华南师范大学数学科学院,硕士毕业于中山大学数学学院,毕业后先在追一科技研究自然语言处理,随后加入月之暗面,长期在广州工作。
他早期提出的旋转位置编码 RoPE,以间接的数学形式解决了 Transformer 处理长序列时的位置信息问题,兼顾计算效率与外推能力。RoPE 此后被许多现代大模型采用,也将苏剑林从工程社区作者推到了 Transformer 基础组件贡献者的位置。
自 2008 年起持续更新的个人技术博客「科学空间」,长期覆盖数学、物理、天文、机器学习与 NLP,被许多硕博毕业生视为学习大模型技术的重要参考。工作之后,他又在 bert4keras、RoFormer、RoPE、attention 变体、优化器与 MoE 等方向持续输出,逐步形成了把复杂模型拆解为普通工程师可复查问题的能力。
Kimi K2 与 K3:把个人积累带入前沿训练
加入 Kimi 后,苏剑林的个人公式与小实验得以进入真实的前沿模型训练:
- K2 主要处理 agentic intelligence 与大规模 MoE 训练;
- K3 进一步引入 1M 上下文、原生视觉、KDA、Stable LatentMoE 与更大的模型规模。
这些都是小模型上难以完整回答的工程问题,包括位置编码的长程外推、attention 变体是否真的省 KV cache、优化器能否 scale up、MoE 是否能保持负载均衡等。对于 Kimi 技术团队而言,苏剑林既能从数学、工程与公开解释三方面理解架构取舍,又能连接理论直觉、工程消融与前沿训练研究,被视为团队稀缺的能力。市场传言他是 Kimi 团队唯一可以居家办公的人,这在技术社区看来并不令人意外。
Attention Residuals:进入 2.8 万亿参数模型
2026 年 3 月,Kimi 团队发表论文 Attention Residuals,署名为陈广宇、张林与苏剑林。团队组合呈现出鲜明的开源社区背景:
- 张林是 Kimi 研究员,也是 FLA 的共同建设者之一;
- 陈广宇是 17 岁的少年技术人才,曾通过 GitHub 向 FLA 提交 DeltaFormer 实现,加入 Kimi 后主要负责加速 KDA 内核。
这也是杨植麟招人的一贯审美:从各类开源社区、论坛与顶尖高校寻找最强的技术工程师。
AttnRes 早期方案为 Full AttnRes,模型每一层都能直接查看此前所有层的输出,每个 token 再根据当前内容选择重点读取的信息,在内部小规模实验中展现出明显优势。随后 Kimi Infra 团队加入,论证大规模工程落地的可行性。尽管 AttnRes 最终成果出来时 K3 已接近定版,团队内部一度讨论是直接用到 K3 还是留到下一代。最终由杨植麟拍板,AttnRes 进入 K3。3 月 16 日技术报告公开发布后,马斯克转发并给出评价:「Impressive work from Kimi」。
从关键人到关键部队
技术报告本身很难提供充分数据证明 AttnRes 让 K3 产生了质的提升,更像是系统性提升的结果。但 K3 验证了 AttnRes 可以成功进入 2.8 万亿参数的完整训练与推理系统,让模型更有选择地使用不同深度的信息,且成本可控。
对月之暗面而言,苏剑林级别的核心专家兼具三重价值:对结构机制的顶级理解、带团队探索技术落地场景的能力,以及通过个人技术吸引力持续招募高智商工程师的辐射效应。正如社区评论所言:「好多博士生靠人家博客毕业呢。」这也解释了为什么文章将他称为 Kimi「真正意义上的关键先生」。
(来源:36 氪经授权转载自微信公众号「The AI Outlook」)
