桃子桃子快讯
返回首页
模型发布

DeepSeek-V4-Pro 正式版实测:Agent 能力大幅跃升,定价同步上调

DeepSeek 悄然上线 V4-Pro 0813 正式版,Agent 与代码基准全线大涨,输出价格翻 3 倍;36 氪…

2026.08.13 · 周四4 分钟阅读

DeepSeek 在 8 月 12 日晚悄然上线 V4-Pro 正式版(版本号 0813),没有发布会也没有官宣推文,但 API 文档里的更新足够引发关注:DeepSWE 基准从 12.8 提升到 62.7,约 4.9 倍跃升;与此同时,官方明确表示将"计划近期整体上调 DeepSeek API 服务定价,预计涨幅较大"。36 氪用一整夜时间,把 V4-Pro 0813 接入 Claude Code 兼容接口,跑了 7 项从旧基准到新基准的递进式测试,验证它的真实水位。

正式版转正,参数与定价同步上探

V4-Pro 并非新模型,而是从今年 4 月的 Preview 状态转正。正式版在关键参数上做了实打实的扩展:上下文长度支持 1M,输出上限拉到 384K Token,支持 thinking 与 non-thinking 双模式(默认开启思考),接口同时兼容 OpenAI 和 Anthropic 两套格式,Claude Code 等 Agent 框架可直接换 base_url 接入。

定价方面,V4-Pro 较 V4-Flash 明显上抬:按每 1M token 计算,缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元;V4-Flash 对应分别为 0.02 元、1 元、2 元。输出和未命中输入价格均涨至 3 倍。

九项基准全线大涨,官方叙事从"答题"转向"办事"

官方把 V4-Pro 的核心叙事从"更会答题"切换为"更会把一件事干完"。第三方解读的数据为:DeepSWE 从 12.8 提到 62.7(软件工程),Terminal Bench 2.1 打到 87.9(终端操作),Cybergym 升至 83.3(网络安全),NL2Repo 涨到 61.5(自然语言转代码仓库);较 Preview 版本分别提升 15.8、30.6、23.0、49.9。社区也有不同声音:有开发者认为 0813 仍略逊于 Luna MX,也有人指出约一半基准落后于 Kimi K3。

7 项实测:前端审美质变,简单题却偶发翻车

36 氪采用了 Karpathy 推荐的"新基准"思路,避开鹈鹕骑自行车这类老题,但因后者被广泛测试过、便于做对照,仍保留作为第一题。

  • 鹈鹕骑自行车(SVG):翻车。脚踩在踏板上但踏板不在车架上,即便把推理强度从 max 降到 high 仍未修正。
  • 60 种风格 Bento 卡片墙:一次通过,60 种风格差异显著,对"设计语法"的理解到位。
  • 老水手文字转动画:叙事与节奏完成度高,但月亮绘制出错,与鹈鹕题"低级失误"如出一辙。
  • Three.js 3D 打砖块:机制闭环、碰撞准确、配色摆脱"AI 蓝紫渐变"印象。
  • 指环王霍比屯 3D 场景:洞屋、宴会长桌、烟火要素齐全,零漂浮零穿模,单场景与 Opus 5 不相上下。
  • React Three Fiber 浮岛创意站:耗时 1.5 小时,全程自测启动、零 Bug 交付;运镜、转场、交互均较 V4-Flash 显著提升,唯一不足是初始界面过曝。
  • 记账本全栈三轮迭代:连续完成核心记账、分类统计、预算提醒,每轮真实跑测试、不通过则自修,全程无需介入。

高性价比路线仍在,但免费窗口正在收窄

把 7 项测试放回桌面,V4-Pro 0813 的画像比官方数字更立体:前端审美告别"一眼假"阶段,创意类任务与长周期工程"能连续干活"的能力均是质变;鹈鹕与月亮两处低级失误仍无规律可循,样本之外尚需更多验证。

值得注意的是,Grok 4.6 与 0813 几乎同步发布,一个顶级闭源、一个顶级开源,均走超高性价比路线。36 氪已筹备两者的同题对比。与此同时,DeepSeek 主动告别价格战,或预示 AI 大模型集体转向高性能、高价值路线——免费午餐的窗口正在关闭。

信源