DeepSeek V4 Pro 0813 上线:基准大涨但实测翻车,全球大厂被迫降价
DeepSeek V4 Pro 0813 悄然更新,多项基准接近翻倍,但独立评测与鹈鹕测试表现不及预期,行业降价潮仍在持…
8 月 12 日深夜,DeepSeek 官网 API 文档页面完成了一次静默更新,Pro 模型版本号更换为 DeepSeek-V4-Pro-0813。与官方群中同步放出的跑分表显示,该版本在多项基准上较预览版有大幅跃升,部分指标已比肩头部旗舰模型。但围绕这次更新是否构成一次完整发布,外界仍有不小疑问。
跑分表上的「V5 级」跃升
根据官方群流出的跑分数据,DeepSeek V4 Pro 0813 在多个 Agent 与代码能力基准上几乎翻倍:
- Terminal Bench 2.1:被官方描述为「性能比肩当下最强模型 Claude Fable 5」
- DeepSWE:预览版 12.8 分 → 正式版 62.7 分,涨幅约 5 倍
- DSBench-Hard:31.1 → 67.2
- DSBench-FullStack:41.8 → 71.1
DeepSWE 与 DSBench 是衡量代码 Agent 能力的核心基准,这一组提升幅度在业内并不常见。如果数据可信,将 V4 Pro 称为「V5 级别」并不夸张。
硬件规格与定价:延续 MoE,调用方式不变
V4 Pro 延续了 MoE 架构设计,总参数规模 1.6 万亿,每次推理激活约 490 亿参数。接口侧提供 100 万 token 上下文与最高 38.4 万 token 输出,对长任务 Agent 而言是硬刚需——大型代码库、长时间运行日志与连续工具调用会快速消耗窗口,窗口不够就只能不断压缩记忆,影响任务连贯性。
调用方式保持不变,模型名仍为 deepseek-v4-pro,老用户无需修改代码即可自动切换。价格方面,0813 版每百万 token 缓存未命中输入 3 元、输出 6 元,与预览版完全一致,并未因模型「转正」而上调——而此前官方曾暗示价格将要上涨。
全球降价潮:DeepSeek「斩杀线」下的连锁反应
V4 Pro 上线的大背景,是 DeepSeek V4 Flash 正式版(7 月 31 日)已对全球定价体系形成显著冲击。根据 Artificial Analysis 的测试,V4 Flash 在完成相同水平任务时,价格低于市面上 70% 的模型,构成一条独有的「斩杀线」。
受此影响,主要厂商接连降价:
- OpenAI:GPT-5.6 Luna 7 月 9 日上线,7 月 30 日即宣布降价 80%,输入价从每百万 token 1 美元砍至 0.2 美元,输出价从 6 美元砍至 1.2 美元
- Anthropic:Claude Opus 5 定价改为 5 美元/25 美元(Sonnet 5 的半价),Sonnet 5 首发优惠价 2 美元/10 美元,8 月 10 日直接将优惠价变为永久价
- 谷歌:7 月 21 日一口气发布三款 Gemini Flash 轻量模型,主力款 3.6 Flash 输出价永久下调 17%
- 国内:智谱 8 月 11 日重置 GLM Coding Plan 全员额度并叠加 1.5 倍限时加成;火山引擎为 GLM-5.2 给出四倍折扣系数;OpenRouter 上 GLM-5.2 的三家供应商从 60% 折扣一路打到 95%
值得注意的是,OpenAI 在降价当天同步发布的技术博客称 GPT-5.6 Sol 自优化生产推理内核,端到端服务成本降低约 20%、token 生成效率提升 15% 以上。但相比 80% 的降幅,仅靠内部效率提升难以完全覆盖,外界普遍认为这是「斩杀线」压力下的被动让利。
旗舰未降:斩杀线之外的另一种活法
并非所有模型都被卷入降价潮。站在金字塔尖的旗舰——GPT-5.6 Sol、Kimi K3、Claude Fable 5——一个都没降价。以 Kimi K3(2026 年 7 月 16 日上线)为例,国际版 API 定价输入 3 美元/输出 15 美元(每百万 token),国内版输入 20 元/输出 100 元,相比 K2.6 输入价上涨 208%、输出价上涨 270%。
这背后的逻辑是:DeepSeek V4 Flash 总参数仅 284B,在 Artificial Analysis 智能指数中仅得 50 分,明显低于头部旗舰。它能扫过「够用就好」的广阔市场,但在复杂推理、长链路任务、多步规划与深度领域知识判断上,完成率与可靠性仍不及头部模型。「必须万无一失」的高端场景,暂时还在斩杀线之上。
推测解码与静态知识剥离:斩杀线还会继续下移
业界普遍认为,DeepSeek 的价格优势并非不可追赶,关键变量在于两项技术:
- 推测解码:用小模型快速出草稿,大模型并行验证修正,草稿命中率稳定在 80% 以上时,旗舰模型有效推理成本可降至原来的 1/3 到 1/5。DeepSeek 于 2026 年 6 月发布 DSpark 推测解码模块,部署到 V4 Flash 与 V4 Pro 线上流量后,同吞吐下单用户生成速度提升 60%–85%
- 静态知识剥离 / Engram:DeepSeek 联合北大在 2026 年 1 月发表的论文《通过可扩展查找实现条件记忆》中提出,让模型在思考过程中把事实性知识从参数中拆出去,只靠外部检索补充,腾出「脑容量」做真正需要推理的任务
DSpark 的成功已带动更多厂商部署推测解码,这意味着斩杀线在未来还会继续下移。
独立评测与鹈鹕测试:V4 Pro 真的「转正」了吗?
围绕这次更新,外界最大的声音是质疑。官方仅在三处留下发布痕迹:官网「模型 & 价格」页面、首页一句滚动公告、一张跑分表;官方更新日志仍停留在 V4 Flash 正式版。
权威评测机构 Artificial Analysis 上线了 V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为 53 分,较预览版的 45 分确有提升,与 GLM-5.2 齐平。但这一档位与 Fable 5 差距明显,无法匹配跑分表中「接近甚至超过 Fable 5」的说法——同日发布的 Grok 4.6 拿到 61 分。在以数学能力著称的 Proof Bench 上,V4 Pro 正式版甚至未能挤进前十。
在更贴近真实使用场景的「鹈鹕测试」(生成鹈鹕骑自行车的循环动画 SVG,要求轮子、踏板与腿部动作协调)中,V4 Pro 正式版的表现反而不如 V4 Flash 正式版——后者在鹈鹕动作与背景云彩细节上明显更好。AI 博主「牙医」也指出,V4 Pro 0813 在长程 Agentic Coding 任务中倾向于「早停」,50 轮测试中两次在 42–43 轮就提前结束,未跑完全部机会。
一种可能的解释是,0813 只是一个「占位符」版本号,DeepSeek 实际上并未上线完整新模型,而是先占住坑位,待后续与 DeepSeek Harness 一起正式发布——而 8 月 13 日正是 Harness 的最后一次内测。在 Harness 内测群中确实出现过「0813 版本计划发布 Harness 公测版」的消息。无论原因为何,从独立评测与社区实测看,V4 Pro 正式版当前的状态,距离跑分表呈现的「V5 级」表现仍有差距。
