桃子桃子快讯
返回首页
开源

月之暗面 Kimi K3 开源,总参数达 2.8 万亿

Moonshot AI 发布 Kimi K3 并在 Hugging Face 开源,总参数 2.8T、激活参数 1042…

2026.07.29 · 周三3 分钟阅读

月之暗面(Moonshot AI)旗下 Kimi K3 模型正式在 Hugging Face 开源,开放权重文件、技术报告及配套训练工具。这是目前公开发布的最大规模开源模型,上线半小时内即获得约 4000 次点赞,关注度位居开源模型前列。模型本身具备多模态能力,没有明显功能短板。

规模与激活参数

Kimi K3 的总参数量达到 2.8 万亿(2.8T),刷新了开源模型的体量上限。实际推理时激活的参数量为 1042 亿,约为上一代 K2 的三倍,也高于当前多数主流开源模型的完整本体规模。换言之,仅激活部分就已超过许多开源模型的总参数。

架构创新

为驾驭这一规模,Kimi K3 在注意力机制与 MoE 路由上做了多项改造:

  • 混合注意力:信息先经过 Kimi Delta Attention(KDA),在持续读取文本的同时将关键信息写入不断更新的状态中;每隔三层 KDA 之后再接入一层 Gated MLA,让模型在做完几页「笔记」后回看原文,防止遗漏关键信息。
  • Attention Residuals(注意力残差):在信息传递路径上加入残差连接,减少深层网络中的信息损失。
  • Stable LatentMoE:将原本 7168 维的隐藏状态先压缩到 3584 维,再分发给 16 个专家并行处理;并为各专家设置限流与排班机制,避免部分专家长期过载、部分长期闲置。

得益于上述架构、数据与训练方法的共同升级,Kimi K3 在总参数显著放大的同时,训练效率相较 K2 提升约 2.5 倍。

开源生态与外部环境

本次开源延续了 DeepSeek 等团队「把家底亮出来」的风格。技术报告披露的许多设计选择——包括多头潜在注意力(MLA)、混合专家(MoE)、推理与训练稳定性优化——都借鉴了开源社区过去几年的积累;Kimi 团队在此之上提出的 KDA、Gated MLA、AttnRes 与 Stable LatentMoE 等新结构,也是开源模型之间「接力迭代」思路的延续。

另一方面,Kimi K3 的发布也引发了国际层面的关注。部分美国政客对模型提出蒸馏指控,Moonshot 团队随即公开反驳;NVIDIA 创始人黄仁勋此前也联合微软、Google、OpenAI 等近百家企业,公开反对针对中国开源模型的限制措施。

随着顶级开源模型在能力上持续逼近闭源旗舰,开源与闭源之间的差距正在缩小。Kimi K3 的发布,再次印证了开源社区层叠迭代的潜力。

信源