DeepSeek为何敢涨价?中美大模型价格分叉的三股力量
美国头部模型降价、中国前沿模型涨价,背后是Agent入口争夺、开放权重模型替代效应与每任务成本重定价。
8月10日,Anthropic 取消了 Claude Sonnet 5 原定 9 月生效的 50% 涨价计划,继续维持 2 美元/10 美元(每百万 Token 输入/输出)的长期价格。仅隔数日,DeepSeek 在官方 API 定价页预告近期将「整体涨价」,并称「预计涨幅较大」。与此同时,OpenAI 已在 7 月 30 日把 GPT-5.6 Luna 价格砍掉 80%。连续两年向下的大模型价格曲线,在中美两个市场出现了罕见的分叉。
OpenAI 与 Anthropic 之间的价格战
美国本轮降价最直接的原因,是 OpenAI 与 Anthropic 在 Agent 场景下越来越激烈的正面争夺。6 月已有外媒消息称 OpenAI 内部讨论大幅削减 Token 价格,目的是从 Anthropic 手里争夺用户;7 月 30 日的降价精准落在承担大量 Agent 执行工作的 Terra 和 Luna 上,外媒指出这进一步向 Anthropic 施压——Claude 在企业和开发者市场占据重要位置,但价格偏高。
Anthropic 取消 Sonnet 5 涨价,与 OpenAI 守住 Sol 30 美元输出价、同时砍 Luna 80% 的策略形成对照。两家厂商都在执行同一条逻辑:守住最强模型的能力溢价,尽量不让海量普通 Agent 工作白白流向更便宜的替代品。Agent 市场正在形成「降低使用门槛 → 更多真实任务运行 → 暴露更多失败模式 → 改进 Agent → 再争取更多工作负载」的循环。
中国开放权重模型压缩了溢价任务范围
价格竞争只解释了一半。另一股压力来自 DeepSeek、Qwen、Kimi、GLM 等中国开放权重模型正在快速扩大的可替代任务范围。它们未必在所有任务上追平最强的 Claude 与 GPT,但正在占据一个更有战略价值的位置:哪些工作已不再需要最贵的模型。
Citi 数据显示,OpenRouter 平台上开放模型处理的 Token 占比从 1 月的 34% 升至 6 月的 65%,当时平台最受欢迎的四个模型全部来自中国。Coinbase CEO Brian Armstrong 预计未来 18 个月约 80% 的 AI 工作负载会迁往成本低约 99% 的模型;Palo Alto Networks CEO Nikesh Arora 直接喊话模型公司,应按未来更低的 Token 价格提前定价。
这才是中国开放权重模型对 OpenAI、Anthropic 价格体系的真正压力:规划和复杂推理交给 Claude 或 GPT,分类、信息抽取、简单代码修改、格式转换等大量步骤交给 DeepSeek、Qwen 或其他便宜模型——过去一个任务 100% 的 Token 流向某一家旗舰模型,现在其中大部分可能被 Router 分走。
企业开始把模型当成可替换零件
斯坦福 Digital Economy Lab 今年 4 月发布的《Enterprise AI Playbook》提供了直接证据:研究团队调查了 41 家机构、9 个行业、7 个国家的 51 个已成功部署的企业 AI 项目。结果显示,42% 的项目认为底层模型完全可以替换;在常规、规则明确的任务中,这一比例达到 71%;到了需要复杂推理、专业知识或高风险决策的高级任务,只有 18% 认为可以随意替换。
一位科技公司运营负责人已在内部建立 multi-LLM gateway,原则是「每一个请求都在成本、准确率、相关性和延迟之间重新判断」。客户还在,但模型忠诚度正在下降。
Agent 改写了模型经济学的计量单位
聊天时代一次问题对应一次或几次调用,Coding Agent 接到一个任务后则会读文件、制定计划、调用终端、修改代码、运行测试、再循环,一次用户指令背后可能出现几十甚至上百次调用。真正的成本越来越接近:任务成本 = Token 价格 × Token 数量 × Agent 步骤 × 重试次数。
企业真正关心的指标逐渐变成 Cost per successful task——一个 0.5 美元的模型如果需要试 40 次,可能比 5 美元但 8 步完成任务的模型更贵。开发者社区维护的 Coding Agent 实测项目 DRadar 把 Codex、DeepSeek 等模型放在同一套真实开源仓库任务中比较,结果显示:高推理档位通常任务表现更高,但成本以数倍甚至数十倍上升;DeepSeek V4 Flash 等低价模型则落在「能力略低、成本大幅降低」的区域,更接近真实 Agent 经济学。
斯坦福研究还发现,高自主度系统出现明显生产率优势:在 AI 自主完成 80% 以上任务、人类主要处理异常情况的 Escalation 模式下,中位生产率提升达 71%;其他两种人机协作模式中位提升均为 30%。
DeepSeek 与 Kimi,两条不同的涨价路线
DeepSeek 最大的资产,是过去一年用极低价格建立起来的巨大使用规模和开放生态。Artificial Analysis 测算 V4-Flash 跑完一组 benchmark 平均仅需约 3 美分,远低于 GPT-5.6 Sol 的 1.86 美元。即便价格翻几倍,它和美国旗舰之间仍存在足够宽的价格带。如果涨价后调用基本留存,说明全球采用已超出「因为便宜所以用」;如果大量任务迅速迁移到其他模型,极低价格此前的作用就比想象中更大。DeepSeek 还没有证明拥有定价权,但已经开始拥有测试定价权的资格。
Kimi K3 走的是另一条路。月之暗面从一开始就把这款长程 Coding、Agent 与知识工作旗舰放在更高价格带:每百万 Token 普通输入 20 元、输出 100 元,同时开放权重。接近 Kimi 的人士提到,定价主要看模型成本,原则还是要赚钱,DeepSeek 不在考虑范围内、场景不一样。K3 发布数日后由于需求超过算力,Moonshot 一度暂停新订阅、把容量优先留给现有付费用户,说明中国开放权重模型进入全球市场,不再只有「价格做到美国模型十分之一」这一种打法。
Token 单价越来越不重要
价格只是表层。文章尝试构建一个综合真实调用、生产部署、分发渠道、开发者生态、商业变现和持续使用六个维度的「模型 Adoption Index(MAI)」作为观察参考。基准、媒体热度和搜索指数不纳入,因为它们更多反映能力或关注度。MAI 基于公开信息做分析性评分,并非行业统计标准;Claude、DeepSeek、Kimi 等模型的分数背后,采用结构已经明显分化:Claude 优势集中在企业生产部署和分发渠道,DeepSeek 靠低价与开放生态把规模做大、Kimi 靠开放权重扩大分发、用高价 API 与商业合作承接高价值需求。
最终被重新定价的是 Task 本身:每天到底有多少真实工作,愿意持续运行在某个模型或某个模型组合上。Token 调用量与绝对定价越来越难以直接代表商业价值——一个模型调用很多,可能只是因为便宜;一个模型价格很高,也不等于真正拥有定价权。
