桃子桃子快讯
返回首页
行业动态

算力围墙逼出的架构创新:中国大模型如何拆解 Transformer

Kimi K3 权重开源背后,中国 AI 公司系统性改造注意力、残差连接与优化器,重塑推理账单与全球存储需求。

2026.07.28 · 周二8 分钟阅读

7 月 27 日深夜,月之暗面将 Kimi K3 完整权重挂上 Hugging Face。十天前的中文讨论多停留在「开源追平闭源」的跑分层面,但对工程界而言,更值得关注的是架构清单:注意力换成 KDA 混合线性机制,残差连接换成注意力残差,优化器换成按头调节的 Muon。深度学习沿用九年的「三大件」,在同一个模型里被重做了一遍。这条由美国出口管制逼出来的技术路线,正在反过来改写全球算力与存储的账单。

算力围墙与「数据墙」

2022 年 10 月起,美国对华出口管制将 A100、H100、H20 等高端 AI 芯片列入清单。算力围墙拦得住芯片、设备与内存颗粒,却拦不住模型架构设计,因为注意力、更新规则、参数组织不需要过海关。围墙越高,墙内拆 Transformer 就拆得越狠。

月之暗面创始人杨植麟 3 月 17 日在 GTC 上做了一场 40 分钟的《How We Scaled Kimi K2.5》演讲,未提任何芯片管制,但他点出了另一面「数据墙」:高质量数据是有限的,token 效率决定了智能还能再涨多少。算力墙决定谁先走、要走多快;数据墙决定这条路迟早有人走。回看这四年,MLA、DSA、KDA 再加上 MoE 极限稀疏路线,密度最高的架构创新几乎全部出自算力围墙之内。

参数的两本账

围墙内的中国模型第一刀瞄准训练与推理共用的算力:DeepSeek V3 以 6710 亿总参数、370 亿激活参数开路,Kimi K2 推到 1 万亿总参数、320 亿激活,刚上线的 Kimi K3 进一步拉到 2.8 万亿总参数、1042 亿激活。总参数对应知识容量,只有激活参数才进入算力账单,两本账由此分开。

第二刀落在每个参数占的字节上。DeepSeek V3 用 FP8 跑通 6710 亿参数训练;Kimi K3 把推理权重压到 MXFP4,并叠加量化感知训练,字节再缩一半。第三刀砍在训练过程本身:研究者 Keller Jordan 在 nanoGPT 提速赛拿出 Muon 优化器,月之暗面在百亿参数级别验证其效率约为 AdamW 的两倍,并以改良版 MuonClip 训完 1 万亿参数的 K2,K3 进一步细化到按注意力头独立调节。第四刀是注意力残差(AttnRes):每层输出不再无差别叠加主干,而是由注意力对前面各层做选择性聚合。按 Kimi 论文口径,训练算力可省约两成。

拆墙并不完美:MoE 省算力却不省权重。K3 在 MXFP4 精度下仍有约 1.4TB,官方建议 64 卡起步,专家们学会轮班,宿舍却一间不能少。

从笔记本到白板:KV 缓存的四年

推理账本的另一半是 KV cache。以 Llama 3.1-70B 为例,单 token 缓存约 320KB,128K 上下文要吃掉 40GB,100 万 token 则要 320GB——而英伟达 Rubin 旗舰单卡显存总共也才 288GB。

过去四年 KV 优化大致走了四步:共享(GQA 把 Llama 3.1-70B 单 token 缓存从约 2.5MB 降到 320KB)→ 压缩(DeepSeek 的 MLA,KV 开销再降 93.3%)→ 按需读取(V3.2 轻量打分、V4 记忆合并与分层筛选,百万 token 计算量降至前代 27%、KV 占用降到 10%)→ 改写记忆机制(线性注意力以固定维度矩阵代替 KV,体积可控)。

Kimi 采用 3:1 混合架构:3 层 KDA 线性层穿插 1 层全注意力,相比传统 MLA 基线 KV 缓存最高省 75%,百万 token 吞吐提升 6 倍。K3 的 93 层中约 3/4 为 KDA、1/4 为门控 MLA,KDA 状态大小固定,门控 MLA 每 token 只存低维向量,24 层合计约 24KB。对比 Llama 3.1-70B 单 token 320KB,K3 虽参数大 40 倍,缓存反而小 13 倍。但白板矩阵无法按前缀拆分复用,Kimi 因此重写缓存逻辑并贡献给 vLLM,同时采用差异化定价:命中复用每百万 token 0.3 美元,未命中 3 美元,相差 10 倍。

分岔:各家走出的不同路线

DeepSeek 走稀疏压缩,笔记照记但压小、挑着读;Qwen 与 Kimi 走混合线性;智谱 GLM-5 把 MLA、DSA 等既有零件重新组合,把 MLA 的每头维度从 192 提到 256 同时削减头数三分之一,理由是 DeepSeek-V3 的头数按 H800 硬件特性选定,换芯片后结构常数也需重算。一套架构通吃所有芯片的时代或许正在结束。

MiniMax 的路线最为曲折:M1 走线性与 Softmax 混合,M2 转向全注意力,M2.5 延续全注意力,到 6 月发布的 M3 才进一步切换到自研 MSA 稀疏注意力。预训练负责人孙浩海解释,规模做大后复杂多跳推理会明显吃亏,不把模型做大结论很难成立。Kimi Linear 论文前后脚挂上 arXiv,同一类零件两家旗舰给出相反答案。行业共识是:谁也没敢把 Softmax 注意力清零,分歧只在留多少、留在哪。

白送的 token 与系统级优化

解码阶段受限于带宽,芯片大半时间在等数据。投机解码让小号草稿模型先猜 5 个候选,大模型用一趟前向同时「判卷」,判五个和写一个耗时几乎相同;上月 DeepSeek 发布的 DSpark 引入置信度打分与负载感知调度,单用户出 token 速度提升六到八成半。Kimi 则把集群里空转的 CPU、主内存与固态盘编成共享缓存层,请求命中已计算前缀直接取现成结果,传输引擎已进入 vLLM、SGLang 与 TensorRT-LLM。

K3 技术报告给出的官方数:整体 scaling 效率约为 K2 的 2.5 倍。中国模型的优化路径指向同一件事:Transformer 原设计为最坏情况留足余量,每个参数都被使用、每段历史全量重读、每趟权重搬运只产出一个 token;而 MoE、稀疏与线性注意力、注意力残差、投机解码的组合,让每一步不再为最坏情况全额付费,每一次优化都相当于「白送」了 token。

杰文斯悖论:账单的方向

效率提升并未压低总额。K3 旗舰版把 48B 试验里省下的 75% KV 空间换成 1M 上下文、常开 thinking 与 2.8 万亿参数,输出价每百万 token 15 美元,接近 K2.6 的四倍。月之暗面商业化负责人黄震昕回应称,「开源模型,包括中国模型,不是低价标签」。

硬件需求随之重排:KV 压力减轻,单卡可承载更长上下文与更高并发;但 MoE 把总参数推到万亿级,常驻权重成容量大头,多机路由让瓶颈转向卡间互联带宽。MoE 把「需要一张造不出的超大卡」变成「用一群能连起来的普通卡」,算力的重要性在下降,容量与互联在上升。今年一季度 DRAM 合约价环比涨约九成,省下的显存很快被更长上下文、更高并发、更大参数吃掉,需求从 HBM 外溢到主存与固态盘。

经济学上将这种现象称为杰文斯悖论:效率越高,原本烧不起煤的行业越多,整体消耗越大。大模型同样如此,token 越便宜,百万上下文、深度推理、常驻 agent 等新需求涌入,把省下的算力与内存迅速填满。架构迭代改写账单的结构,却不会改写账单的方向:单位成本下降带来的不是总额缩小,而是更多原本用不起的需求进入使用场景。

信源