桃子桃子快讯
返回首页
开源

Kimi K3 权重与三项 Infra 技术正式开源,登顶 Hugging Face 趋势榜

月之暗面发布 2.8 万亿参数 MoE 模型 Kimi K3 的权重与技术报告,并开源 MoonEP、FlashKDA、…

2026.07.28 · 周二7 分钟阅读

月之暗面于 7 月 28 日发布 Kimi K3 模型权重与技术报告,并同步开源支撑该模型训练的三项关键基础设施技术 MoonEP、FlashKDA 与 AgentEnv。Kimi K3 为 2.8 万亿参数的混合专家(MoE)架构模型,具备原生视觉理解能力,支持 100 万 token 的上下文窗口。模型上线半小时内即以超过 4000 个赞登顶 Hugging Face 趋势榜,被官方称为「迄今为止最快的发布增长速度」。

模型权重与训练 Infra 同步开源

Kimi K3 此次发布包含完整模型权重与技术报告,开发者可自由下载并部署,用于内部研发或终端产品。随模型一同开源的三项训练 Infra 技术分别面向不同环节:

  • MoonEP:为超大规模细粒度 MoE 设计的高性能通信库,可在专家并行通信负载不均衡时保持高效率。
  • FlashKDA:Kimi Delta Attention 的高性能算子,在英伟达 H20 上 prefill 速度相比 flash-linear-attention 基线提升 1.72–2.22 倍,可直接作为替换后端使用。
  • AgentEnv:与 KVCache.ai 合作开发的沙箱系统,为大规模 Agent 训练提供高保真、强隔离的运行环境,支持快照、恢复与分叉。

在架构设计上,KDA+AttnRes 以 3:1 比例混合 KDA 与 Gated MLA,通过块级注意力残差增强跨层信息流动;Stable LatentMoE 在 896 个路由专家中激活 16 个,配合 SiTU-GLU 与 Quantile Balancing 保证高稀疏度下的训练稳定;MoonViT-V2 视觉编码器从零开始以 next-token prediction 训练,无需对比预训练。后训练阶段,模型在通用推理、通用 Agent 与编程 Agent 三大方向进行大规模任务合成,并基于百万 token 上下文完成近 20 个内部评测集的评估。

海外社区与生态平台迅速跟进

Kimi K3 上线前后引发海外开发者社区热议。上线前已有近 3700 名开发者在线等待,页面一度短暂出现 404。北美 AI 基础设施创企 OsmanticAI 创始人 Ahmad 将其称为「本地版 Fable 5」,并建议下载体验以确保「他们永远也夺不走我的 Fable 5」。Hugging Face CEO Clem Delangue 公开称赞其增长速度。

在生态适配层面,多家海外厂商宣布 Day 0 支持:

  • 数字员工 Devin 的开发方 Cognition 将 Kimi K3 接入 Devin 桌面客户端与命令行工具,并称在 FrontierCode 1.1 评测上,Kimi K3 是「首款性能逼近前沿水准的开源模型」。
  • Nebius、Baseten、Fireworks 等海外 AI 基础设施厂商同步宣布适配,Nebius 称其为「首个达到前沿性能水平的开放权重模型」。
  • 华为昇腾 CANN 宣布对模型 MXFP4 量化实现 Day 0 原生支持,并提供在昇腾 950PR/DT 与 Atlas A3 集群上的部署实践;趋境科技基于 SGLang 完成 Kimi K3 在昇腾 910C 超节点上的 Day 0 适配,并同步开源相关成果。

基准测试:编程与 Agent 能力领先,部分视觉任务仍存差距

在官方公布的评测结果中,Kimi K3 在编程与 Agent 任务上表现突出:

  • 编程方向:SWE Marathon、Program Bench 均位列第一;Terminal Bench 2.1 取得 88.3 分,接近 GPT-5.6 Sol;FrontierSWE 以 81.2 分位列第二,仅次于 Claude Fable 5。
  • Agent 与办公:BrowseComp 达到 91.2 分,Automation Bench 与 SpreadsheetBench 2 均排名第一。
  • 综合白领任务:在更贴近真实办公流程的 GDPval-AA v2、APEX-Agents 评测中,Kimi K3 仍弱于 Claude Fable 5 等顶级闭源模型。

视觉能力方面,文档分析 OmniDocBench 达到 91.1 分,超过多数对比模型;但在零样本视觉工具任务 Zerobench 上低于 Claude Fable 5。Kimi 内部 GPU 内核优化测试显示,在最高推理强度下,Kimi K3 表现接近含回退机制的 Claude Fable 5,并超过 Claude Opus 4.8、GPT-5.6 Sol 与 GPT-5.5;其内部 Knowledge Work Bench 在通用推理、深度文档分析与金融专项三类任务上的表现亦超过 GPT-5.5 与 Claude Opus 4.8。

实测案例:游戏、芯片与科研

在实测环节,Kimi K3 Max 模式根据包含「被霸天虎入侵的破败城市地图」「低多边形风格」「5 种擎天柱阵营角色」「5 种霸天虎变种敌人」等复杂设定的提示词,一次性完成 3D 横版格斗游戏的创建且未出现错误。海外开发者 @He1s_Sammy 在游戏设计场景下对比 Kimi K3、GPT-5.6 Sol 与 Fable 5:

  • Kimi K3:方案质量 9.5/10,调用成本 0.030 美元(约 0.2 元)。
  • Fable 5:7.5/10,0.38 美元(约 2.57 元)。
  • GPT-5.6 Sol:7/10,0.11 美元(约 0.74 元)。

官方展示的更长程任务案例包括:基于开源 EDA 工具与 Nangate 45nm 工艺库,在 48 小时连续自主运行中完成芯片构建、优化与验证;一次分析 391 个 GWTC-5 引力波事件,调用 20 多个并发子智能体,产出 7 张科学可视化图、2 张表格并综合 10 余篇论文;从零开发类似 Triton 的编译器 MiniTriton,部分场景性能超过现有工具。

开源生态延伸与地缘背景

相比半年前 DeepSeek-V3 开源时「又一个中国模型」的反应,Kimi K3 上线后海外社区已出现「它比 Claude Opus 强」、「开发者正在把 Fable 换成 K3」等讨论。与此同时,美国参议员蒂姆·斯科特与比尔·哈格蒂已提案扩大商务部权限以限制外国对手接触 AI 技术;美国商务部去年曾考虑将月之暗面、DeepSeek、阿里 Qwen 团队等列入实体清单,白宫亦曾考虑通过行政令要求使用中国模型的美国企业对安全事件承担责任,OpenAI、Anthropic 等闭源厂商曾提案禁用中国开源模型。商务部对此回应称这是「典型的人工智能霸权主义行径」,并指出近 200 家美国初创企业敦促政府不要切断对中国开源模型的访问。

信源