Kimi K3 走红后遭遇算力焦虑
Kimi K3 开源模型爆红却暂停新用户接入,暴露算力紧缺与商业化压力,估值半年涨 12 倍,推理经济性与国产芯片迎来关…
Kimi K3 以 2.8 万亿参数的开源模型身份登顶各大基准测试榜单,热度直追前沿闭源模型。然而,爆红之后,月之暗面在 7 月 19 日发出通知,因算力逼近极限暂停 C 端新用户接入,把「接住用户」摆在了比 ROI 转正更优先的位置。这场突如其来的算力焦虑,将中国开源大模型的「能力上限」与「商业可持续性」之间的鸿沟推到了台前。
K3 走红与算力告急
Kimi K3 被业内视为「年度最强开源模型」,参数量达到 3T 级别,在多个基准测试中登顶,部分榜单甚至超越美国前沿闭源模型。在算力受限的条件下,Kimi 通过算法与工程优化叠加参数扩展,逼近闭源前沿水平,也打破了 Scaling Law「撞墙」一说。OpenAI 战略负责人迪恩·W·鲍尔即直言:「开源模型会阻碍人工智能领域的进一步资本支出。」
热度直接传导到算力消耗上。7 月 19 日晚间,Kimi 发出通知暂停新用户体验 K3 的通道,把已有算力优先分配给存量用户。通知解释称,需求超过预期,存量算力逼近极限。Kimi 企业业务负责人黄震昕在沟通会上表示:「我们已经在非常努力地通过模型性能的优化和算力供给来解决问题。」
多位行业人士指出,相较此前通过 Token Plan 限售留口子的做法,直接暂停接入意味着算力供给上已无腾挪空间。一位资深科技投资人直言:「它自己的算力都没法批量获取,现在这么多用户想用都没法开通付费账户,严重影响商业变现和用户口碑。」上海财经大学教授胡延平认为,原因在于算力准备不足而非 ROI 未转正,当前比 ROI 转正更重要的,是「接住用户」。
技术架构与 Scaling 路径
期智研究院研究员李彪指出,从已披露信息看,K3 并未呈现范式级的全新架构。KDA 与 AttnRes 模块此前已有论文,本次更值得关注的是将这些模块与极稀疏 MoE、低精度训练和大规模并行系统整合,并扩展到 2.8 万亿参数。「由于 K3 完整技术报告尚未发布,目前仍难以评估其全部技术增量。」
李彪强调,K3 再次说明「size still matters」——模型规模仍是提升前沿能力的重要变量,但能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。对于 2.8 万亿参数的极稀疏 MoE 模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。另一位学术研究员也认为 K3 的核心壁垒来自底层 Infra 与工程能力:「大家思路都大差不差,归结到底变成软件工程了。」
前述科技投资人表示,K3 的冲击在于两点:Scaling Law 仍在继续,中国公司也能快速掌握当前最前沿模型的训练配方。紧随 K3 之后,阿里 Qwen 3.8 预览版(2.4 万亿参数)也迅速上线。当可靠的 Scaling 路径打通后,下一步就是钱的问题。
融资节奏与估值跳涨
Kimi 一直是一级市场的「当红炸子鸡」。2025 年 12 月 31 日,杨植麟在内部信中确认完成 5 亿美元的 C 轮融资,投后估值 43 亿美元,账面现金持有量超过 100 亿元。彼时杨植麟判断,一级市场仍可募集更大量资金,B/C 轮合计金额已超过绝大部分 IPO 募资及上市公司定增,因此短期不着急上市。
半年后,外媒披露 Kimi 计划在 8 月启动上市前最后一轮融资谈判,目标估值 500 亿美元,相当于 DeepSeek 上一轮融资完成后的水平。同一时期,Kimi 也开始拆 VIE 架构、加速赴港上市流程,意在冲击继智谱、MiniMax 之后的大模型第三股。半年之间估值上涨近 12 倍,但 100 亿元现金在 K3 火爆、算力告急的背景下,已难以覆盖扩张需求。
推理经济性与芯片「第二战」
前述科技投资人指出,K3 目前证明的是技术能力进入前沿,但推理经济性、产品体验和商业模式尚未完全跑通。根据 Artificial Analysis 的「智能指数」评测,K3 在 9 项测试中共输出约 1.3 亿 Token,跑完整套评测总账单 2709.75 美元,而同类参评模型中位数仅 6300 万。但拆解到单一任务,K3 平均花费 0.94 美元,低于 GPT-5.6 Sol 的 1.04 美元与 Claude Opus 4.8 的 1.8 美元。
胡延平提醒,如果「不考虑量效比,长期竞争会是问题,某些时间点会出现 token 不经济」。他以英伟达为例:H200 上 token 的 ROI 可能为负,但升级到 B300 则可能分秒都是「印钞机」。这给国产算力提出了新要求——既要保证算力供给,也要在硬件层面释放 token 的经济性。
SemiAnalysis 5 月报告显示,在 MiniMax-M2.5 的 8K/1K 负载下,B200 NVFP4 在高吞吐交互下单用户速度可达 110 tok/s/user,每百万 Token 成本 0.09 美元;同条件下 H100 FP8 为 0.74 美元,性价比差距超过 8 倍。
2026 WAIC 上亮相的华为昇腾 Atlas 950 超节点,单柜从 32 卡升级到 64 卡,计算柜从 12 个增至 16 个,机柜内高密度铜缆电互联、机柜间全光互联,从支持千亿参数训练扩展至万亿参数低精度训练与混合推理。若按 64 卡机柜 100kW 功耗上限换算,1GW 约对应 10000 个 Atlas 950 机柜、64 万张 NPU;按单卡均价 10 万元计算,整笔订单也将是 600 亿元量级。
如果说上市是中国芯片的第一场战争,那么接住国产大模型的需求、为其 token 成本托底,将是关键的第二战。
