桃子桃子快讯
返回首页
开源

Kimi K3 发布:2.8 万亿参数开源权重模型登陆 AWS

Moonshot AI 发布 2.8 万亿参数 MoE 模型 Kimi K3,为首个进入 3 万亿参数级别的开源权重系统…

2026.07.31 · 周五4 分钟阅读

Moonshot AI 于 2026 年 7 月 27 日发布 Kimi K3,这是首个进入 3 万亿参数级别的开源权重模型。Kimi K3 采用 MoE(Mixture of Experts)架构,总参数规模达 2.8 万亿,原生支持文本与视觉多模态输入,上下文窗口达 100 万 token。模型权重已在 Hugging Face 开源,组织可在自有基础设施上自托管这一前沿级智能系统。AWS 同日发文介绍在 SageMaker HyperPod 与 EKS 上部署该模型的两种路径。

核心架构与关键参数

Kimi K3 构建于一套差异化的架构之上,融合了 Kimi Delta Attention(KDA)、Gated Multi Head Latent Attention(MLA)以及 Stable LatentMoE 框架。模型将 2.8 万亿参数分布在 896 个专家网络中,每个 token 仅激活其中 16 个,单次前向传播的活跃参数约 1040 亿,相比前代 Kimi K2 在扩展效率上实现了约 2.5 倍的提升。

关键规格一览:

  • 总参数:2.8 万亿
  • 每 token 活跃参数:约 1040 亿
  • 架构:MoE(896 专家,每 token 激活 16 个)
  • 上下文窗口:100 万 token
  • 模态:原生多模态(文本 + 视觉)
  • 发布日期:2026 年 7 月 27 日

模型在长时序编码任务、智能体工作流与复杂推理方面表现突出,原生支持工具调用、结构化输出以及面向多步问题求解的「始终思考」(always-on thinking)模式。

权重格式与推理引擎

Kimi K3 的开源权重在 Hugging Face 以 moonshotai/Kimi-K3 为标识提供,采用 MXFP4(Microscaling Floating Point 4-bit)格式,在模型质量与显存效率之间取得平衡,适合大规模推理部署。

由于模型规模庞大,推荐使用 vLLM 作为推理引擎。vLLM 原生支持 MoE 架构、张量并行以及 MXFP4 量化格式,对应的 day-0 推理容器已发布为 vllm/vllm-openai:kimi-k3,后续将合入主分支容器。

在 AWS 上的部署路径

部署 Kimi K3 需要 NVIDIA B300 Blackwell Ultra GPU,AWS 上对应的实例类型为 ml.p6-b300.48xlarge,单实例配备 8 块 B300 GPU,并具备高带宽互连以支持跨完整专家池的张量并行推理。AWS 提供两种主要的容量获取方式:

  • SageMaker HyperPod 灵活训练计划(Flexible Training Plans):为 HyperPod 集群提供预留容量,保障 GPU 资源可持续用于推理负载。
  • 容量块(Capacity Blocks):允许按指定时段预留 EC2 GPU 实例,无需长期承诺即可锁定 p6-b300 容量,EKS 工作负载可通过定向预留容量使用这些资源。

两条主要部署路径:

  • Amazon SageMaker HyperPod 方案:通过 Inference Operator 自动管理容器编排、模型加载与端点管理,是最简化的部署路径。
  • Amazon EKS 方案:基于 Kubernetes 生态,适合已有 K8s 运维体系的团队,可灵活接入容量块预留资源。

无论选择哪种方案,都需先在 SageMaker 控制台创建编排模式为 EKS 的 HyperPod 集群,并在实例组中配置 ml.p6-b300.48xlarge;若走 HyperPod 路线,还需绑定 Flexible Training Plan 以确保所需容量可用。

信源