桃子桃子快讯
返回首页
行业动态

阿里、字节、DeepSeek竞逐5–10万亿参数大模型

阿里云栖大会宣布将训练5万亿至10万亿参数模型,DeepSeek、字节跟进,国产大模型掀起新一轮参数军备竞赛。

2026.09.23 · 周三6 分钟阅读

9月22日的云栖大会上,阿里巴巴 CEO 吴泳铭披露,公司正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。同一日,阿里 ATH 事业群 Token Foundry Qwen LLM 项目负责人刘大一恒也提到,Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,Qwen4.5、Qwen5 的参数规模计划迈向5万亿到10万亿。几乎同一时间,The Information 报道 DeepSeek 正在训练约2万亿参数的新模型,其创始人梁文锋在投资者会议上表示下一步计划把模型推到8万亿参数;更早两个月,《金融时报》援引知情人士称字节跳动正在训练最高可达10万亿参数的大模型。三家头部国产厂商在参数规模上同步加码,信号明确。

国产阵营的现有坐标与海外差距

把视角放到已发布的国产模型上,目前的顶点是月之暗面7月推出的 Kimi K3,总参数2.8万亿,是全球首个开源的3万亿级别模型;阿里当前旗舰 Qwen 3.8-Max 约2.4万亿,DeepSeek 现役 V4-Pro 为1.6万亿。闭源海外阵营的参数估计更高:业内估算 Anthropic 的 Mythos 5 约8万亿,Fable 5 约5万亿。也就是说,国产已发布模型的参数顶点距离海外头部水平还差一到两倍,若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍。

对比之下,2025年引爆行业的 DeepSeek-R1 参数量仅6710亿,不足10万亿的十五分之一,从千亿到数万亿的跃迁在三年内已经完成。

Scaling 信仰与边际递减

支撑「越大越好」这一判断的核心是 Scaling Law:在模型、数据、算力三者同步放大时,模型能力会随之提升,过去几年从千亿到万亿的每一次跃迁都伴随着能力的肉眼可见的跳跃。这也是阿里把 Scaling 视为 ASI 关键路径的逻辑基础。但 Scaling Law 并非无限有效,其前提是参数、数据与算力同步扩大,且数据必须是「高质量数据」。到了万亿级别,单纯堆参数的边际回报明显递减,如果喂不进等量的高质量语料,能力不会同倍提升。

架构层面同样关键。Kimi K3 总参数2.8万亿,采用 MoE(混合专家)架构,896个专家每次只激活16个,实际激活参数仅约1040亿。MoE 的核心贡献是把总参数与实际调用参数解耦:总参数继续膨胀撑住能力上限,单次计算量却被按住,不随总规模同比变重。这也是 Flash 类模型与大参数模型能够共存的技术基础,前者优化高频、实时、成本敏感场景,把激活参数压到极小;后者押注最难、最杂、能力覆盖最广的场景。

万亿美元级的烧钱账单

大参数模型直接推高的是基础设施投入。OpenAI 训练 GPT-4(参数量约2万亿)时,算力需求以千亿 Token 计,需要成千上万张 GPU 协同运转数周乃至数月;10万亿参数预训练所需的 GPU 数量与时长还要再上数十个台阶,意味着数万张高端 GPU 连续运行数月,芯片采购、集群运维、电费均为天文数字。

阿里云栖大会披露,到2032年其运营的全球数据中心规模将超过20GW;高盛此前估算阿里已上线容量约3–4GW,未来六年需新增约16–17GW,规模扩大到目前的5倍以上。按英伟达 CEO 黄仁勋此前在财报电话会上透露的信息,建设1GW算力成本约500亿至600亿美元,由此推算阿里未来六年新增算力的总建设投入可能达8000亿至1万亿美元量级。

推理侧的支出同样不可忽视:参数越大,单次推理调用的算力越多,模型部署到千万级用户日常调用后,推理开销往往比训练更持久、更烧钱。此外,数据也是一笔隐形账单,模型扩大要求训练数据同步扩大且质量提升,高质量、精细清洗与标注的数据比裸算力更稀缺。

资本市场已经在为这场竞赛买单。海外方面,微软、谷歌、Meta、亚马逊四家2026年资本开支指引已飙至约7200亿至7450亿美元。国内方面,阿里2026年 Q2 单季资本开支677亿元,同比大增75%,自由现金流由正738亿元骤转为负466亿元;过去5个季度阿里自由现金流有4个季度为负,账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于 AI 基础设施。字节方面,The Information 报道其今年上半年净利润同比下降至约200亿美元,2025年 AI 相关投入达1500亿元,2026年进一步增至2000亿元,近日完成约300亿美元银团贷款,为科技公司史上最大规模之一。

Flash 与大参数:两条路线的并行

云栖大会前不到一个月,阿里刚把 Qwen3.8-Flash-Next 推向前台:1250亿总参数、每次推理仅激活60亿,训练成本较前代砍掉近90%,API 定价最低到 DeepSeek-V4-Flash 的三分之一;同日,智谱的 GLM-5.3-Flash 也挂上开源榜,3200亿总参数、激活180亿。当时行业的关键词是「成本革命」,比拼的是谁更省、更快。一个月后云栖又把「大」字推回 C 位,两种打法开始共存,本质上是同一套 MoE 底座上同时押注「小而快」与「大而强」两条路线。

不过,10万亿目前仍是 PPT 上的数字,现役国产旗舰的参数顶点仍是2.8万亿,等模型真正落地,牌桌可能已经洗过一轮,届时10万亿将不再是终点,而是新的起跑线。

信源