桃子桃子快讯
返回首页
行业动态

DeepSeek 涨价引连锁反应:Token 价格最高涨 12 倍

DeepSeek V4 Pro 与 Flash 正式涨价,引入峰谷定价,输出价格最高涨 4.71 倍,引发订阅平台与开发…

2026.08.18 · 周二7 分钟阅读

8 月 17 日,DeepSeek V4 Pro 与 V4 Flash 的新价格正式生效,峰时缓存命中价格从每百万 Token 0.003625 美元提高到 0.044 美元,变为原来的 12.14 倍;V4 Pro 输出价格从 0.87 美元提高到 3.96 美元,约为原来的 4.55 倍;V4 Flash 峰时输出也从 0.28 美元提高到 1.32 美元,变为 4.71 倍。与此同时,DeepSeek 引入峰谷定价,谷时价格为峰时的一半,官方划定的峰时为 UTC 时间 1 时至 4 时、6 时至 10 时,换算成北京时间正好覆盖上午 9 时至 12 时和下午 2 时至 6 时,也正是国内企业与开发者最集中的工作时段。

此前,DeepSeek 留给市场最鲜明的标签是「极致低价 + 接近第一梯队的能力」。用户能够容忍偶尔答错或工具调用不稳定,因为极强性价比足以覆盖这些小问题。这次涨价直接动摇了这一默契,在社区引发广泛讨论。

五条渠道,同一个 DeepSeek

理解涨价影响,首先需要厘清 DeepSeek 的销售渠道:

  • 官方 API:按缓存命中、普通输入与输出 Token 计费,叠加峰谷价格,开发者与 Agent 平台的边际成本主要由其决定。
  • 模型聚合平台(如 OpenRouter):同一模型接入多家推理服务商,用户可在价格、速度和可用性之间选择。
  • 云平台:同时存在原厂 API 转售、自行部署、区域节点、企业折扣与包量套餐等。
  • 订阅服务(如 OpenCode Go):用户支付固定月费,平台承担模型采购与成本波动。
  • 自行部署开放权重:成本转化为 GPU 租金、量化精度与推理框架投入。

多渠道并存意味着,官方涨价并不等同于市场上所有 DeepSeek 服务在同一天、按同一幅度上涨。截至 8 月 18 日,DeepSeek V4 Pro 0813 已接入 11 家服务商,多数线路普通输入与输出价格集中在每百万 Token 1.32 美元与 3.96 美元,GMICloud 折后最低为 1.218 美元与 2.436 美元,阿里云国际最高为 1.452 美元与 4.356 美元;缓存价格差异更大,从 0.044 美元到 0.44 美元,相差 10 倍。

涨价后,性价比还在吗

将 V4 Flash 与竞争对手 Luna 横向对比可以看到:在峰时,普通输入 0.44 美元为 Luna 的 2.2 倍,输出 1.32 美元比 Luna 高 10%;但缓存读取 0.014 美元仍比 Luna 低 30%。到了谷时,输入 0.22 美元只比 Luna 高 10%,输出 0.66 美元反而比 Luna 低 45%,缓存读取 0.007 美元比 Luna 低 65%。

这意味着:

  • 缓存较少、输入经常变化的应用,在峰时使用 Luna 可能更便宜。
  • 大量复用上下文的代码 Agent,V4 Flash 仍有机会保留优势。

开源软件工程任务评测项目 DRadar 通过真实软件工程任务,结合不同推理强度下的表现与实际消耗,绘制「综合成本—能力」位置图。涨价前,V4 Flash 低推理档与 V4 Pro High 仍占据部分性价比前沿;涨价后,模型得分未变,综合成本坐标却明显右移。即使按谷时价格计算,V4 Flash 多个档位也开始被 Luna 以更低成本、更高能力覆盖;V4 Pro High 则移入 Sol、Terra 的成本区间,能力未形成相应领先。

涨价成本由谁承担

第一道传导层是 Token Plan 运营商。OpenCode Go 月费 10 美元,平台希望通过批量折扣与预留 GPU,为用户提供最高约 60 美元的模型用量。但 DeepSeek 涨价后,V4 Flash 套餐使用价值被定为 30 美元,V4 Pro 仅 15 美元。按 OpenCode 披露的典型请求结构(410 个新增输入 Token、7.13 万个缓存 Token、310 个输出 Token),每五小时 12 美元的使用上限内,V4 Flash 约可完成 7600 次请求,V4 Pro 约 1050 次。

作为参照,同一计划中 GPT-5.6 Luna 约 2050 次,MiniMax M3 约 3200 次,Hy3 约 4300 次,MiMo-V2.5 则达 3.01 万次。固定月费不变,上游价格压力被转化为更低的使用倍率与更少的估算调用次数,最终由订阅用户以「可用量减少」的形式承担。面向多模型重度用户的 Cola Token Plan 也表示,DeepSeek 综合成本增加约 3 至 6 倍,已将 Flash 与 Lite 的套餐消耗标准整体调整到此前约三倍。

第二批承受压力的是薄毛利 AI 应用。写作、翻译、客服与知识库产品通常采用固定订阅,难以在涨价当天同步提价,模型路由、上下文压缩、峰谷调度与限制重度用户都将被用于维持毛利率。第三批是 Agent 平台,单次任务可能产生数十轮模型调用,任何环节不稳定都可能导致 Token 价格优势被重试成本抵消。

Harness:DeepSeek 的「运行时」答案

面对涨价带来的成本压力,DeepSeek 给出的另一个答案是 Harness——一套「一切皆插件」的 Agent 运行时框架。模型、工具、技能、会话、沙箱、存储、Agent 循环、任务调度和用户界面都能被加载、卸载或替换,模型在此架构中只是一个组件。截至 8 月 18 日,DeepSeek Harness 在 GitHub 已获约 15.3 万 Star 与 1.6 万 Fork,社区围绕它建立了插件目录、插件市场、桌面客户端、文件工作台、模型切换、MCP 管理、会话恢复与费用监控等周边项目。

不过,社区也指出了具体问题。例如有开发者发现 Harness 极简模式执行毫秒级命令时启动需约 3.5 秒,原因在于底层终端等待 dsh> 提示符、上层持久化 Shell 插件却使用了另一字符串,两层程序只能等到超时。修改两处代码后,命令延迟从约 3600 毫秒降至 158 毫秒。这一案例说明:Agent 的真实成本还包含工具等待、失败重试与额外上下文,运行时上的小错误就可能消耗掉模型在 Token 价格上节省的成本。

DeepSeek 官方在项目首页以大写字母提醒,后续「会出现破坏兼容性的变化」。对于开发者预览版属正常风险声明,但若企业计划私有化部署,则意味着 Harness 尚未形成稳定的生产标准。涨价之后,DeepSeek 仍拥有开放权重、百万 Token 上下文、中文能力与较高开发者认知,这些优势能否支撑数倍于旧价格的账单,将取决于它与 Luna、GLM、Kimi 等开放模型在推理、工具调用与代码能力上的逐项较量。

信源