月之暗面开源 K3:2.8 万亿参数的门槛与红利
月之暗面以 Modified MIT 协议开源 Kimi K3,参数达 2.8 万亿,腾讯云、阿里云百炼等多家云厂商 d…
7 月 27 日,月之暗面在 Hugging Face 公开了 Kimi K3 的完整权重,采用 Modified MIT 许可证,参数规模达到 2.8 万亿。开源当天,腾讯云 ADP、阿里云百炼、TokenHub、国家超算互联网、值得买科技 OpenHubs 等多家国内平台,以及 Together AI、Modal 等海外服务商均宣布 day-0 接入。这是国内头部大模型厂商迄今公开的最大规模开放权重之一。但值得留意的是,开源前一周(7 月 20 日),月之暗面刚刚因算力紧张暂停 C 端新用户订阅。这两件事看似矛盾,背后实则是两条不同的生意线:C 端卖 API 调用,开源卖的是产业链改造权。
硬件门槛:百万美元起步
K3 在 MXFP4 量化后,权重文件约 594 GB。要将模型完整塞进显存,至少需要 8 张 H100 80GB;而在生产环境中,KV 缓存与激活值会进一步把显存撑满,业内通常需要由 64 张以上 H100 组成的超节点才能稳定运行,硬件成本百万美元起步。单张 RTX 4090 连 K3 的一个专家模块都放不下。相比之下,Llama 4 最小 7B 版本可在笔记本运行,DeepSeek V4 的 490B 活跃参数也能用消费级显卡折腾。K3 直接把门槛拉到机房级别,普通人、小团队乃至多数中型企业都被挡在门外。
真正的买家:云厂商与小 B 端
K3 的直接买家是云厂商和软件服务商,最终获益者则是中小 B 端与垂直团队。开源后,多家云厂商同步托管 K3,用户不需要自建机房,直接调用 API 即可使用 2.8 万亿参数的基座。此前 K3 的 API 仅由月之暗面官方提供,定价权集中;多家云厂商入场后,议价空间随之出现,长期看不会被单一厂商锁死。
许可证方面,Modified MIT 允许商用、修改与再分发,不强制衍生作品开源。商业公司可基于 K3 做闭源行业定制模型,不必公开业务代码——这是闭源 API 无法提供的权利。此外,K3 采用稀疏 MoE 架构,理论上支持选择性蒸馏。未来社区可只蒸馏高频激活的专家子集,做出单卡可运行的「K3 学生模型」,70B 甚至 7B 的蒸馏版几个月后或可能出现。
与 DeepSeek 的差异化路径
月之暗面和 DeepSeek 都选择了「用开放权重换生态规模、靠生态摊薄成本、最终通过 API 与解决方案变现」的路线,但侧重不同:
- DeepSeek V4 通过极低的激活参数与峰谷定价,把 API 成本打到行业地板,Flash 缓存未命中输入价仅 0.14 美元。
- K3 主打前沿性能,官方定价为 3 美元输入、15 美元输出,缓存命中 0.30 美元;月之暗面称编程场景缓存命中率可超 90%,重度用户实际输入成本约为标价的 1/10。
短期内 K3 难以复制 DeepSeek 的极致价格战,但其价值在于把前沿性能级的改造权下放给了产业链。
改造权下放:规则已经变了
K3 不会让小团队明天就拥有 2.8 万亿参数的本地部署能力,但它改变的是游戏规则本身:以前闭源大厂一手攥着模型、一手定着价格,中小客户连议价和定制的资格都没有;现在 K3 把模型改造权放到了牌桌上。硬件门槛没有降低,降低的是改造门槛——云厂商扛算力、微调团队切场景、蒸馏生态降门槛,最终通过产业链分层传导到小 B 端。
需要注意的是,这份红利是张「期货合约」,兑付依赖宽松的许可证、充足的云厂商算力供给以及活跃的社区生态。任何一环收紧,中小企业的选择权都可能快速缩水。跑不起 K3 的人,才是这场变化的最终受益者。
