DeepSeek 上线 V4-Flash-Vision-Exp 多模态实验模型
DeepSeek 推出 V4-Flash-Vision-Exp 实验版多模态模型,多模态智能体性能逼近 Opus-4.8…
DeepSeek 近日在其官方 API 平台上线了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,主打「文本能力不掉队、多模态智能体大幅增强」的方向。该模型继承 V4-Flash 的文本能力,同时在多模态智能体基准上实现显著跃升,整体表现接近 Opus-4.8。同步发布的 DeepSeek Harness 0.1.1 已开箱支持该新模型,开发者可立即接入使用。
模型定位与文本能力
V4-Flash-Vision-Exp 定位为「V4-Flash 的多模态升级版」,在文本侧保持与 V4-Flash 一致的水平,覆盖以下核心能力:
- 智能体(agent)任务
- 推理(reasoning)
- 世界知识(world knowledge)
这意味着用户无需为视觉输入场景额外切换模型,即可在保持原有文本表现的前提下,获得多模态能力。
多模态智能体性能
根据 DeepSeek 官方披露,V4-Flash-Vision-Exp 在多模态智能体基准上较 V4-Flash 取得「重大跃升」(major leap),性能已逼近 Opus-4.8。这一基准通常考察模型在视觉理解与工具调用、任务规划结合场景下的综合表现,对于需要让模型「看懂屏幕截图、操作界面、混合图文指令」的应用尤为重要。
API 接入与计费
新模型通过标准接口即可调用,关键参数如下:
- 模型名:
deepseek-v4-flash-vision-exp - 支持接口:Chat Completions、Messages、Responses
- 输入形式:支持文本与图像混合输入
- 图像接入方式:base64、外部 URL、Files API
- 计费方式:图像按 token 计费,每张图像最多 384 tokens,沿用 V4-Flash 的定价标准
文档入口已在 DeepSeek 官方 X 账号置顶信息中给出。
工具与生态
为配合新模型发布,DeepSeek Harness 0.1.1 同步上线,提供「开箱即用」(out-of-the-box)的兼容支持,开发者可在熟悉的评估与调试环境中直接调用 V4-Flash-Vision-Exp,无需额外适配。
小结
作为一款实验性多模态模型,V4-Flash-Vision-Exp 在文本能力持平 V4-Flash 的前提下,重点强化了多模态智能体方向,并以与 V4-Flash 相同的图像计费标准降低了接入成本。对于正在构建 GUI Agent、视觉问答、图文混合工作流等应用的团队而言,是一个值得测试的新选项。
