桃子桃子快讯
返回首页
模型发布

Kimi K3 触发「杰文斯悖论」:模型越高效,芯片需求越多?

花旗与美银证券分析师指出,Kimi K3 以 2.8 万亿参数与低价高性能组合,可能推高而非降低对 GPU、内存等基础设…

2026.07.21 · 周二5 分钟阅读

月之暗面发布的 Kimi K3 模型拥有 2.8 万亿参数、面向 100 万 token 上下文窗口与长周期智能体任务,凭借低成本与高性能组合引发关注。花旗和美银证券分析师相继指出,这一模型可能触发「杰文斯悖论」——技术效率提升反而推高总资源消耗,服务器内存、GPU 与推理基础设施需求将持续扩张。

低价高性能组合:调用成本下降不必然减少总需求

花旗半导体分析师 Peter Lee 将 Kimi K3 视为「杰文斯悖论」的潜在案例。该悖论的核心是:技术效率提升降低单位使用成本后,使用量可能大幅增加,最终资源总消耗不降反升。

Kimi K3 的公开定价显示,缓存命中输入价格为每百万 token 0.3 美元,输出价格为每百万 token 15 美元;完整权重计划于 7 月 27 日披露。花旗判断,模型降价不会自动减少硬件需求,低成本反而可能提高开发者与企业的调用意愿,推动更多 AI 智能体部署。智能体任务并非一次性问答,而是在连续任务中不断生成、读取和处理 token,调用次数与任务长度上升会把单位成本下降重新转化为总资源消耗。

长上下文与 MoE 架构:压力传导至内存与互连

Kimi K3 采用三项关键技术:Kimi Delta Attention 旨在降低 100 万 token 上下文窗口的成本,Attention Residuals 用于在模型不同深度之间选择性检索表征,Stable LatentMoE 则将稀疏化推到极致,每个 token 仅激活 896 个专家中的 16 个。月之暗面的技术资料显示,这套架构使扩展效率达到 K2 的 2.5 倍。

但花旗强调,推理端资源压力并未因此消失。Kimi K3 需要多节点集群,超级节点配置超过 64 颗 GPU。更重要的是,长上下文与智能体任务会推高 KV Cache 占用,进而增加推理端内存负担。DDR5 承担高频数据存取,eSSD 则受益于更大的缓存与数据存储需求。

美银证券半导体分析师 Vivek Arya 指出,MoE 推理要求系统更高效地搬运数据、调度专家模块,并连接更大计算集群。英伟达的测算显示,GB300 NVL72 在领先开源模型上的每瓦性能最高可达 Hopper 平台的 25 倍。CoreWeave 围绕 Kimi K2.6 的测试也印证,开源 MoE 模型若要在速度与性价比上保持领先,仍依赖经过优化的英伟达 GB300/GB200 NVL72 基础设施。这意味着,模型权重可能逐步商品化,但运行模型所需的 GPU、高带宽内存、网络互连和推理系统不会失去价值。

模型差距收窄:领先者被迫加码算力

美银证券认为,更强的中国开源模型未必让美国 AI 巨头削减算力投入,相反模型差距收窄会提高领先者维持优势的成本。若开源模型持续逼近,OpenAI、Anthropic 和 Google 需要依靠更大规模训练、更多强化学习与合成数据循环、更重的测试时推理,以及更快的产品发布节奏来守住差异化。当模型能力趋同,竞争压力会传导至 GPU、HBM、高速网络和推理系统等底层基础设施。

Token 使用量持续扩张:需求端尚未见顶

美银证券引用 OpenRouter 数据指出,第三方 API 平台上的 token 使用量持续增长,其中中国 AI 实验室模型的 token 使用量已超过非中国实验室模型。这显示开发者在开放模型生态中的选择正在变化,模型价格下降与能力提升可能推动调用量继续扩张。

Ramp 数据显示,截至 2026 年 6 月,约 55% 的美国企业已付费订阅 AI 模型、平台或工具,远高于美国人口普查局 BTOS 调查的 21% 估计。按模型看,Anthropic 企业采用率为 42.4%,OpenAI 为 39.5%。但 AI 支出高度集中:头部 1% 的企业用户平均每名员工每月 AI 支出约 4833 美元,前 10% 为 516 美元,整体中位数仅 11 美元。科技与媒体行业订阅率达 79.8%,大型企业采用率为 65.5%。

花旗与美银证券的共同结论是,Kimi K3 的意义不在于单一模型是否降低单位推理成本,而在于低成本是否释放更大规模的工作负载。对花旗而言,最直接的受益方向是服务器 DDR5 与 eSSD;对美银证券而言,更关键的是 GPU、HBM、高速网络与推理系统,因为模型竞争加剧会迫使领先者继续投入基础设施。

信源