DeepSeek V4 Pro 正式版深夜上线,性能逼近顶级模型,成本仅 1/46
DeepSeek V4 Pro 0813 正式版悄然更新,10 项 Agent 基准中 8 项与 Claude 顶级模型…
DeepSeek 又一次在深夜悄然出手。8 月 12 日,原本处于预览状态的 DeepSeek V4 Pro 被替换为正式版本 DeepSeek-V4-Pro-0813,没有博客文章,也没有社交媒体公告,更新最早是通过 API 模型与价格页面的变化被外界发现,随后在 OpenRouter 上线可查。
正式版相比预览版的跃迁
V4 Pro 最早于今年 4 月 24 日以预览版身份亮相,配备 1.6 万亿总参数、490 亿激活参数,并将 100 万 Token 上下文设为 V4 系列标配。本次 0813 正式版在多项 Agent 基准测试上较预览版有显著提升,其中最突出的是面向长周期软件工程能力的 DeepSWE 基准,得分从预览版的 12.8 跃升至 62.7,提升接近 5 倍。DeepSWE 考察模型在真实开源代码仓库中自主理解代码、跨文件修改、运行测试并完成多轮修正的能力,这一跃升反映的是连续工具调用与多步骤软件工程能力的实质增强,而非简单的代码生成加速。
与 Claude Fable 5 的对比
DeepSeek 官方群发布的覆盖 10 项智能体基准的横向对比显示:在 Claude Fable 5 占优的 8 项中,0813 正式版与 Fable 5 的差距极小。10 项平均差距 5.3%,剔除「无工具版人类终极考试」这一极端样本后,剩余项目平均差距仅 2.8%。在 CyberGym(AI 网络安全攻防)和 AutomationBench Public(AI Agent 自动化)两项基准上,0813 反超 Fable 5。
价格成为最大变量
在性能逼近的同时,V4 Pro 0813 的定价保持不变:输入 0.435 美元 / 百万 Token,输出 0.87 美元 / 百万 Token,缓存命中输入低至 0.003625 美元 / 百万 Token。作为参照,Claude Fable 5 输入为 10 美元、输出 50 美元 / 百万 Token。综合折算均价约为 Fable 5 的 1/46,规模化使用场景下的成本差异更为显著。需要注意的是,DeepSeek 此前已在用户后台预告将对 API 整体提价,新价格与生效时间尚未公布。
Grok 4.6 同日登场
几乎同一时间,马斯克为 Grok 4.6 站台,将其定位为「智能、快速且性价比极高的产品」。Grok 4.6 基于 Grok 4.5 打造,重点强化长时间运行的 Agent 与复杂视觉任务,已登陆 Cursor、Grok Build 及 API 等渠道,输入 2 美元 / 百万 Token、输出 6 美元 / 百万 Token。这意味着 DeepSeek 与 xAI 几乎在同一时间节点,把各自的旗舰模型推到了开发者面前。
实测差异与行业意义
在 HN 讨论区,有开发者将两个模型同时接入 Codex CLI 进行对比:V4 Pro 0813 用时 12 分 02 秒、成本 0.12 美元,但出现 Bug;Grok 4.6 用时 3 分 18 秒、成本 1.41 美元,无 Bug。这一结果提醒行业,单次实测不足以给模型下定论,Agent 任务的随机性较高。但从行业层面看,顶级闭源模型与高性价比开源模型之间的性能差距正在持续收窄,而成本曲线仍在向开源一侧倾斜。
