Kimi 开源之后:中国大模型的开源、推理与底座三场战
围绕 Kimi 2.8 万亿参数开源模型 K3 及其引发的讨论,梳理中国大模型在开源突围、推理成本下探与国产算力底座三方…
近日,一篇以「Kimi 发布 2.8 万亿参数开源模型 K3」为切入点的产业评论在科技圈流传。文中将 Kimi K3 视作中国大模型在开源赛道对闭源巨头的一次正面冲击,并把围绕这一事件延展开来的讨论归纳为三条主线:算法层面的开源突围、推理层面的成本平权、以及底层硬件的全栈国产化。
一、开源:从堆算力走向极限工程优化
文章认为,过去一年 OpenAI、Anthropic 等头部玩家依靠海量算力与闭源 API 构建了高门槛的商业护城河,欧美巨头以算力资金门槛和集群工程壁垒筑起黑盒,将全球中小开发者、垂直行业团队内化为 API 下游的「数字打工仔」。
在中国侧,受限于先进芯片获取与超大集群建设成本,AI 公司难以复制「十万张 H100 暴力堆砌」路线,转而走极限工程优化道路。文章援引 K3 的 2.8 万亿参数规模说明:稠密模型每次推理激活全部参数在算力受限环境下不可承受,而 MoE 架构通过高度优化的动态路由,让每次推理仅激活全网中极小比例的专家网络,从而在同等推理表现下大幅压缩显存占用与计算开销。
与此同时,文章指出,硅基流动、无问芯穹等基础设施厂商正通过异构集群调度、vLLM 投机采样、PagedAttention 显存管理、低比特量化无损落地以及不同品牌芯片池化调度,把推理侧单次成本压到物理极限,分流全球中长尾开发者,从应用端倒逼闭源巨头让出溢价。
二、推理:从快思考走向慢思考与成本平权
文章将中国大模型的下一阶段竞争归纳为「推理平权」。其逻辑是:当 Scaling Law 在纯无监督预训练阶段触及高质量语料枯竭与算力转换效率拐点后,行业共识正在从「堆参数」转向「拉推理时间」——模型必须从基于直觉的快思考,进入多步推演、自我验证、试错回调的慢思考。
在国产阵营中,文章列举的动作包括:阿里发布 2.4 万亿参数的 Qwen3.8、DeepSeek 在 R 系列架构上对推理成本的下探、智谱 GLM 与月之暗面 Kimi 在长序列逻辑上的持续演进。论点是:在极度考验奖励模型精细度与蒙特卡洛搜索优化的角斗场里,绝对算力垄断正在失效,「慢思考」能力能拉平由基础显卡数量造成的表层差距。
由此衍生出一个商业判断:一旦中国大模型企业将高阶推理能力的单次消耗成本压缩至海外对手的十分之一甚至百分之一,B 端 Agent 落地的 ROI 障碍将被扫除,全球企业级数字员工将获得廉价且无限供给的推理供给。
三、底座:全栈国产化的硬骨头
文章承认一个客观现实:国内绝大多数 AI 企业的算力仍依赖存量合规海外高端 GPU 与国产算卡的混合部署,过渡态的异构架构仍是常态。当海外存量硬件寿终正寝、向十万卡级集群演进无可回避时,本土产业链必须完成对物理底座的彻底替代,否则上层算法成果都将面临地基被抽走的风险。
文章点出两个最关键的瓶颈:
- HBM 与先进封装:参数加载与推理计算受限于内存带宽,需要垂直堆叠 DRAM 裸片并依赖硅通孔互联的 HBM 技术,国产化需打通先进半导体材料、纳米级封装工艺、良率爬坡、散热控制、集群互联通信等环节。
- 软件栈:英伟达的真正护城河并非芯片,而是近百万开发者用二十年写就的 CUDA 闭源生态;中国异构芯片产业必须深入硬件指令集底层,重写算子、定制内存分配架构、调优分布式通信原语,将本土软硬件栈打磨到工业水准。
文中点名的攻坚方包括长鑫存储在 HBM 量产与良率上的持续投入,以及华为昇腾、壁仞、燧原等国产 GPU 在 CANN 等独立软件栈上的算子与生态适配。
综述
文章最终把中国 AI 的产业切面归结为三层:上层的工程极限压缩、中层的推理平权突围、底层的硬件血泪攻坚。作者认为,相较于「AI 登月」式的宏大叙事,更值得关注的是在极端约束条件下靠韧性一砖一瓦拼出的算力底座。
