模型发布
DeepSeek V4 Flash 基准跑分反超 V4 Pro Preview
DeepSeek 报告 V4 Flash 在 Terminal-Bench 2.1 上得 82.7,高于 V4 Pro…
2026.08.06 · 周四约 2 分钟阅读
DeepSeek 近日披露了 V4 系列在 Terminal-Bench 2.1 基准上的测试结果:轻量版本 V4 Flash 得分 82.7,超过同系列更大体量的 V4 Pro Preview 的 72.1 分。值得注意的是,V4 Flash 的总参数量约为 V4 Pro Preview 的五分之一,即以更少的参数实现了更高的跑分。
基准与跑分对比
Terminal-Bench 2.1 是一类面向终端/命令行任务的智能体能力评测基准,常用于衡量模型在真实操作环境中的执行与推理水平。本次披露的两组关键数字如下:
- V4 Flash:82.7
- V4 Pro Preview:72.1
- 参数量比:V4 Flash 约为 V4 Pro Preview 的 1/5
这一结果意味着什么
在 LLM 评测中,更小的模型以明显更少的参数反超更大体量版本,通常意味着训练策略、架构设计或推理效率方面存在显著优势。DeepSeek 此前在 V3、R1 系列中已展现出以较小参数逼近甚至超越大模型的能力,本次 V4 Flash 的跑分延续了这一趋势。
信息来源与局限
该数据来自社交平台 X 上的一则帖子(由 Together AI 等账号转发),并非 DeepSeek 官方博客或完整技术报告,因此以下信息暂未得到充分验证:
- 具体的参数规模(如 V4 Flash 实际参数量、是否 MoE 架构)
- 测试配置(采样数、温度、上下文长度等)
- V4 Flash 与 V4 Pro Preview 的发布时间与许可证
- 完整的能力对比与价格信息
如需用于横向选型或正式评估,建议等待 DeepSeek 官方放出权重、API 或详细技术说明后再做判断。
