桃子桃子快讯
返回首页
开源

Kimi K3 开源权重今日上线,第三方部署显存测算同步出炉

Moonshot 计划今日上线 Kimi K3 权重,社区托管商完成 A100/H200/B300 三档 GPU 显存需…

2026.07.27 · 周一2 分钟阅读

Moonshot AI 计划于 7 月 27 日将新一代 Kimi K3 模型权重上传至 Hugging Face。消息来自社区托管服务商 qubridInc,其团队已依据 Moonshot 平台文档完成显存需求测算,并将在 A100、H200、B300 三类 GPU 配置上进行实测对比。

模型核心规格

qubridInc 引述的 Moonshot 平台文档显示,Kimi K3 关键参数如下:

  • 总参数量:2.8 万亿(2.8T),采用 MoE 架构
  • 专家数:896 个,每 token 激活 16 个
  • 上下文长度:100 万 token,并附带视觉能力
  • 量化方式:MXFP4 量化感知训练,权重下载量约 1.4 TB

三档 GPU 显存测算

qubridInc 团队针对三种主流数据中心 GPU 配置完成了显存预算推演:

  • 8 卡 A100 80GB:合计显存约 640 GB,远小于 1.4 TB 权重大小,加载模型至少需要三节点;且 Ampere 架构缺乏 FP4/FP8 张量核心,只能用 INT4 等非目标内核降级运行,效果预计不佳
  • 8 卡 H200:合计显存约 1.13 TB,仍无法装入单节点,最少需双节点部署并承担每 token 的跨节点互联开销
  • 8 卡 B300:合计显存约 2.3 TB,是唯一能单节点装下全部权重并保留长上下文 KV cache 余量的配置;Blackwell 原生支持 FP4,与 MXFP4 量化路径契合

qubridInc 表示,A100 与 H200 上的吞吐、首 token 延迟和单 M token 成本数据将在本周内公布;B300 集群预计本周末搭建完成,结果或于下周出炉。

Moonshot 自述短板

qubridInc 同时披露了 Moonshot 在自家模型卡中坦陈的几项局限:

  • 当 agent harness 截断思考历史时,模型质量明显下降
  • 面对歧义场景时倾向直接行动而非反问确认
  • 在基准成绩相近的情况下,聊天体感仍逊于文档中标注为 Fable 5 和 Sol 的对比模型

社区可在原帖评论区追加希望覆盖的 batch size、上下文长度、并行设置等测试维度,qubridInc 表示将纳入测试矩阵。

信源