桃子桃子快讯
返回首页
模型发布

中国开源模型三连击,硅谷阵营公开分裂

Kimi K3 开放 2.8 万亿参数权重,DeepSeek V4 与 GLM-5.2 紧随其后,中国开放模型连续逼近美…

2026.07.28 · 周二7 分钟阅读

7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 正式开放 Kimi K3 的完整模型权重。上线仅半小时,K3 便获得超过 4000 个点赞,登上平台趋势榜第一。Hugging Face 联合创始人兼 CEO Clem Delangue 形容,这是「平台迄今增长最快的一次发布」。Vercel、vLLM、Fireworks AI、Together AI、Modal、Baseten、DigitalOcean 等美国云与推理平台也几乎同步宣布上线支持。Vercel 创始人 Guillermo Rauch 称 K3 为「目前全球最强的开放权重模型」。

这场热闹背后,是中美前沿模型公司在开放与封闭路线上的全面碰撞。就在 K3 开源前夕,OpenAI 与 Anthropic 正在向华盛顿施压,渲染中国开放模型的「蒸馏」与安全风险;与此同时,英伟达、微软、Meta、IBM、Hugging Face 等 25 家公司和机构签署《开放权重与美国 AI AI 领导力》公开信,反对过早限制开放权重模型。OpenAI、Google、SpaceX 最初未在名单上,随后陆续补签,主要美国前沿公司中仅 Anthropic 缺席。

硅谷「分裂」背后的两种生意

OpenAI 与 Anthropic 的焦虑来自商业模式本身。两家公司主要靠订阅与 API 出售模型能力,Claude Code 仅今年 2 月的年化收入已超过 25 亿美元。一旦顶级模型权重公开下载,开发者便可自行部署,原公司很难收回投入。Anthropic CEO Dario Amodei 在 7 月 27 日回应,公司从未主张全面禁止开放权重模型,但支持打击「工业级蒸馏」、限制先进芯片流向中国,并要求所有强模型接受安全测试。

英伟达、微软、Meta 的立场则不同。黄仁勋 7 月 22 日公开表示,优秀的中国开放模型「应该被使用」,美国公司也「绝对应该获准」使用中国模型。7 月 24 日,英伟达牵头成立「开放安全 AI 联盟」,与微软、IBM、Hugging Face、SpaceX AI 等机构共同推进本地可部署、可审计的强模型。联盟公告中提到,此前处理一起 Agent 越界安全事件时,多款闭源工具因安全策略拒绝协助取证,团队最终在本地运行 GLM-5.2,分析了超过 1.7 万次操作并控制入侵。

中国开源「三锤」

过去三个月,中国开放权重模型连续落下三记重锤,每一锤都针对美国闭源模型的一项核心优势。

第一锤:DeepSeek V4 预览版

4 月 24 日,DeepSeek 发布 V4 预览版并同步开放权重。V4-Pro 共有 1.6 万亿参数,每次激活 490 亿参数,支持 100 万 Token 上下文。根据 DeepSeek 模型卡自测数据,V4-Pro 在最高推理强度下的 SWE-bench Verified 得分达到 80.6%,与 Claude Opus 4.6 的 80.8% 几乎相同;BrowseComp 达到 83.4%,也接近 Claude Opus 4.6 的 83.7%、高于 GPT-5.4 的 82.7%。

价格上,DeepSeek 5 月 23 日宣布将原限时 75% 折扣转为长期价格:每百万 Token 非缓存输入、输出分别收费 0.435 美元和 0.87 美元,输出价格约为 Claude Opus 5(25 美元)的 1/29。

第二锤:智谱 GLM-5.2

6 月 16 日,智谱发布 GLM-5.2,同样支持 100 万 Token 上下文,以 MIT 许可证开放权重,重点从「回答问题」转向「长时间干活」:阅读大型代码库、反复调用工具、在数百轮操作中完成软件工程任务。按智谱汇总的各家最佳成绩,GLM-5.2 在 Terminal-Bench 2.1 中达到 82.7%,略低于 GPT-5.5 的 83.4%,高于 Claude Opus 4.8 的 78.9%。

第三锤:Kimi K3

7 月 27 日,Kimi K3 完整权重上线。月之暗面称这是「全球首个开放权重的 3 万亿参数级模型」,总参数达 2.8 万亿,每次激活 1040 亿参数,同时支持图像、视频与 100 万 Token 上下文。在月之暗面公布的测试中:

  • Terminal-Bench 2.1:K3 拿到 88.3%,超过 Claude Fable 5 的 88.0%,距 GPT-5.6 Sol 的 88.8% 仅差 0.5 个百分点;
  • SWE-Marathon(超长软件工程任务):K3 得分 42,高于 GPT-5.6 Sol 的 39 分与 Claude Opus 4.8 的 40 分。

第四锤要打穿的最后一堵墙

三锤落下后,价格、长任务与模型规模都已不再是闭源模型的独占优势。但月之暗面在 K3 模型卡中也坦承,K3 在整体使用体验上与 Claude Fable 5、GPT-5.6 Sol 相比仍有「明显差距」。GLM-5.2 在 Terminal-Bench 2.1 中接近顶级,但同一份智谱数据显示,在 SWE-Marathon 上仅得 13 分,远低于 Claude Opus 4.8 的 26 分。

对企业而言,这些差距直接转化为返工成本:调用便宜模型跑长任务若在最后阶段失败,工程师重新检查、修改、重跑所花的时间,足以吃掉所有节省的 API 费用。DeepSeek-V4 正式版需要证明的不只是更高的评测分数,而是反复运行下依然稳定的工具调用、长上下文与多轮修改能力。

截至目前,DeepSeek 尚未公布 V4 正式版的发布时间与具体规格。创始人梁文锋在近期与投资人的交流中表示,公司「大概率仍会开放最强模型」,商业化只追求「合理利润」。如果这一表态兑现,V4 正式版仍将延续 DeepSeek 最有杀伤力的组合:能力逼近美国旗舰、价格大幅低于对手、同时开放权重。

OpenAI 与 Anthropic 在 Kimi K3 开源当天即推动华盛顿调查蒸馏与制裁,讨论使用限制,正是因为权重一旦被大量下载和部署,后续限制的效果将大打折扣。这场赛跑的下一步,比的是 DeepSeek-V4 正式版的稳定性能否真正追上闭源旗舰,以及主张限制中国开放模型的政策窗口能否抢在发布前落地。

信源