Hugging Face 报告:中国开源模型领跑前沿参数规模
Hugging Face 最新报告指出,中国实验室在千亿级以上开源模型领先美国,多数美国大模型基于中国底座衍生;下载量仍…
Hugging Face 近期发布《开源模型现状:2026 年夏季观察报告》,对中美两国在开放权重模型领域的竞争态势给出系统性盘点。报告核心结论是:中国实验室在千亿参数以上前沿开源模型的供给上持续领先,而美国的竞争重心正从传统模型实验室向英伟达、AMD 等芯片厂商迁移;与此同时,真正被开发者长期使用的是一小组中小规模模型,参数膨胀并未直接转化为实际采用率。
中国模型冲到前沿参数规模
2026 年前七个月,中国开源模型的月度参数规模上限在 7540 亿至 2.78 万亿之间,领先美国超过半数月份。美国同期多数月份的原创模型上限不足 1300 亿参数,仅英伟达 5 月和 6 月发布的 Nemotron 3 Ultra(5610 亿参数)以及 Thinking Machines Lab 的 Inkling(9520 亿参数)突破这一水平。
中国实验室的策略也出现分化:
- 月之暗面、DeepSeek、小米、智谱等新模型主要集中在大参数端;
- 阿里 Qwen 系列则覆盖不同参数规模,形成了多档位路线。
Hugging Face 认为,这种变化与量化工具的发展有关——大型模型可以更快部署到本地设备,实验室不必先发布小模型再逐步放大。同期发布的 1000 亿参数以上美国开放模型中,多数基于中国底座进行微调、量化、格式转换或硬件适配,原创模型数量有限,主要包括 Inkling、英伟达 Nemotron 3 系列以及 Arcee AI 的 Trinity-Large。
美国角色转向芯片与基础设施
英伟达和 AMD 已成为美国 2026 年发布新模型仓库最多的两家公司,各自超过 200 个,远超其他机构。两家厂商的模型大量围绕自身芯片进行优化,模型逐渐成为硬件能力的展示载体。相比之下,谷歌、Meta 等传统模型实验室的开源发布节奏有所放缓,开源阵营的主导者正在从模型实验室向芯片和基础设施公司扩展。
大模型很热,小模型更实用
尽管参数规模持续创新高,下载量并未同步向大模型倾斜:
- 在参数规模已知的模型中,1B 以下模型占历史下载量的 83%,超过 1000 亿参数的模型仅占 1%;
- 2026 年下载量最高的 25 个模型与点赞数最高的 25 个模型只有一个重合,且没有一个是 2026 年发布的模型;
- 通用文本嵌入模型 all-MiniLM-L6-v2 在前七个月被下载 15.5 亿次,但仅获得 5156 个赞。
Hugging Face 指出,点赞集中在新模型发布后的关注期,而下载更多来自已进入开发流程的成熟模型。发布热度并不能直接反映后续采用规模。
阿里 Qwen 系列以覆盖多档位的家族策略累计下载 20.45 亿次,是当前下载量最高的开源模型系列。中国其他前沿实验室的下载则高度集中在大模型端,DeepSeek、月之暗面等机构的下载几乎全部来自 700 亿参数以上模型,谷歌、微软、IBM Granite 在这一规模的下载量几乎为零。
许可证与生态优势
模型开源之后的商业兑现更多依赖许可证友好度与生态规模。报告统计:
- 今年超过 200 亿参数的 178 个中国模型中,59% 采用 Apache 2.0 许可证,22% 采用 MIT 许可证;
- DeepSeek 和智谱甚至以 MIT 协议开放了 7000 亿至 1.65 万亿参数级别的大模型;
- 美国同规模模型中仅 29% 采用 Apache 或 MIT,41% 使用自定义条款,30% 未明确声明许可证。
Qwen 在衍生生态上的规模同样突出,基于 Qwen 的衍生模型已超过 15 万个,2026 年前七个月日均新增 180–210 个衍生仓库。本地运行层面,Qwen 每月 GGUF 格式下载约 3960 万次,接近 Gemma 的两倍、Llama 的五倍多。
围绕模型运行的工具链也在快速增长:过去七个月,Hugging Face 整体模型仓库增长 21.5%,而声明使用 gguf 库的仓库增长 464%,Apple MLX 增长 148%,LeRobot 增长 194%。2026 年 7 月的快照已出现约 2840 亿参数的 DeepSeek-V4-Flash 和约 2.8 万亿参数的 Kimi-K3 的 GGUF 构建,开发者可以通过多台消费级设备本地运行超大规模混合专家模型。
Meta 与英伟达重新入场
面对中国实验室在开源领域的领先,美国公司开始调整策略。
- 8 月 10 日,Meta 发布 Muse Glimmer,采用 Apache 2.0 协议开放权重;
- 一天后,英伟达推出 Nemotron 3.5 Lightning。
两款模型均约 300 亿参数,重点都放在本地部署与智能体工作负载。Muse Glimmer 针对本地智能体、编程和函数调用设计,量化版本可压缩到 20GB 以下;Nemotron 3.5 Lightning 采用混合专家架构,并配套推出开源路由库 NeMo Switchyard,用于按成本、速度和能力调度多个模型。
Hugging Face 同时首次披露了智能体对平台的访问数据:7 月 Claude Code 占比从 4 月的 67.8% 降至 44.4%,Codex 则从 10.4% 升至 20.8%,另有近四分之一流量来自未识别工具。智能体正在成为模型分发与运行的新入口,模型的使用方式正从人工操作扩展到 AI 智能体。
从当前格局看,中国实验室在前沿参数规模和生态建设上取得先手,美国厂商正通过芯片适配与重新入场追赶。决定长期位置的,不再只是模型参数本身,而是模型能否真正进入开发者的日常工作流。
