月之暗面 Kimi K3 开源,总参数达 2.8 万亿
Moonshot AI 发布 Kimi K3 并在 Hugging Face 开源,总参数 2.8T、激活参数 1042…
月之暗面(Moonshot AI)旗下 Kimi K3 模型正式在 Hugging Face 开源,开放权重文件、技术报告及配套训练工具。这是目前公开发布的最大规模开源模型,上线半小时内即获得约 4000 次点赞,关注度位居开源模型前列。模型本身具备多模态能力,没有明显功能短板。
规模与激活参数
Kimi K3 的总参数量达到 2.8 万亿(2.8T),刷新了开源模型的体量上限。实际推理时激活的参数量为 1042 亿,约为上一代 K2 的三倍,也高于当前多数主流开源模型的完整本体规模。换言之,仅激活部分就已超过许多开源模型的总参数。
架构创新
为驾驭这一规模,Kimi K3 在注意力机制与 MoE 路由上做了多项改造:
- 混合注意力:信息先经过 Kimi Delta Attention(KDA),在持续读取文本的同时将关键信息写入不断更新的状态中;每隔三层 KDA 之后再接入一层 Gated MLA,让模型在做完几页「笔记」后回看原文,防止遗漏关键信息。
- Attention Residuals(注意力残差):在信息传递路径上加入残差连接,减少深层网络中的信息损失。
- Stable LatentMoE:将原本 7168 维的隐藏状态先压缩到 3584 维,再分发给 16 个专家并行处理;并为各专家设置限流与排班机制,避免部分专家长期过载、部分长期闲置。
得益于上述架构、数据与训练方法的共同升级,Kimi K3 在总参数显著放大的同时,训练效率相较 K2 提升约 2.5 倍。
开源生态与外部环境
本次开源延续了 DeepSeek 等团队「把家底亮出来」的风格。技术报告披露的许多设计选择——包括多头潜在注意力(MLA)、混合专家(MoE)、推理与训练稳定性优化——都借鉴了开源社区过去几年的积累;Kimi 团队在此之上提出的 KDA、Gated MLA、AttnRes 与 Stable LatentMoE 等新结构,也是开源模型之间「接力迭代」思路的延续。
另一方面,Kimi K3 的发布也引发了国际层面的关注。部分美国政客对模型提出蒸馏指控,Moonshot 团队随即公开反驳;NVIDIA 创始人黄仁勋此前也联合微软、Google、OpenAI 等近百家企业,公开反对针对中国开源模型的限制措施。
随着顶级开源模型在能力上持续逼近闭源旗舰,开源与闭源之间的差距正在缩小。Kimi K3 的发布,再次印证了开源社区层叠迭代的潜力。
