桃子桃子快讯
返回首页
工具

DeepSeek Harness 发布首个重要更新:14 项调整补齐多模态

DeepSeek Harness v0.1.0-rc.8 上线,支持原生图片输入与子代理扩展,并能让纯文本模型借助工具链…

2026.08.20 · 周四4 分钟阅读

DeepSeek Harness 在公测不到一周后迎来首个重要更新。8 月 20 日,DeepSeek Harness v0.1.0-rc.8 版本正式上线,共带来 14 项调整,其中多模态能力补齐成为最受关注的亮点。

多模态正式补齐,可直接看图

rc.8 最明显的变化是 DeepSeek Harness 对多模态输入的全面支持。DeepSeek 模型适配器可通过配置启用原生图片请求,具备视觉能力的模型可直接接收图片;/goal、/plan 等指令也支持图文混合输入。输入框中的 @ 菜单新增文件和会话引用,方便把本地文件、已有会话等内容拉进当前任务。

本次更新的主要调整包括:

  • 原生图片请求:适配器可启用,/goal、/plan 等指令支持图文混合
  • 子代理扩展:Claude Code、Codex 可作为 Profile Bundle 按需安装,Codex 支持非交互权限模式及多个命名实例
  • 终端体验:Windows PTY 终端加入持久 PowerShell 会话,极简模式默认开启
  • 问题修复:大图或多图请求失败、流式生成取消后前缀丢失、自定义 OpenAI 兼容网关调用异常等
  • 性能优化:web_search 并发查询、子代理 reportDelivery 及时唤醒父任务、大型历史会话分叉、SQLite 后端读写性能提升

纯文本模型也能间接「看图」

在原生图片请求之外,一个有意思的细节被开发者发现:当所调用模型本身不支持图像输入时,Harness 会退化到另一套工具链,先进行 OCR 文字识别,再统计图片中的颜色比例、扫描部分像素行,并读取尺寸、色彩模式等元信息。

最终,这些结构化结果会被交给文本大模型,让模型根据 OCR 文本、颜色占比、像素位置等证据推断图片大致内容。例如,一张包含文字和图形的图片可被拆成「文字内容及坐标」「背景颜色比例」「特定区域像素变化」「图片尺寸」等若干组信息。

这种「工具层视觉」与原生视觉模型仍有明显差距:对 PPT 截图、流程图等结构明确的图片效果较好,对真实照片或复杂空间关系的恢复能力则相对有限。

事实上,在官方加强多模态支持之前,DeepSeek Harness 社区已围绕视觉能力出现了一批插件,包括 dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision 以及通过 pi2dsh 桥接的 pi-vision 等,通过 OCR、像素分析、结构化证据或独立视觉子代理让纯文本模型间接处理图片。rc.8 上线后,原生多模态与工具层视觉方案可进一步配合使用。

快速迭代中的插件化思路

8 月 13 日公测时,DeepSeek Harness 团队就强调其核心设计思路是「一切皆插件」:模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力都可由不同插件组合和替换。当 Agent Harness 拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务也可通过工具编排被重新拆解和实现。

rc.8 继续强化这一思路:视觉模型可原生接收图片,纯文本模型能借助视觉工具获得部分图像信息;Claude Code 和 Codex 可作为子代理按需装入同一套 Harness。rc.8 还加入了本地运行 dsh web 自动打开浏览器等优化,进一步降低使用门槛。

从 8 月 14 日开放公测到如今补齐多模态,DeepSeek Harness 仍处于快速迭代阶段。接下来值得期待的是,这套插件化 Harness 能否继续把更多模型、工具和 Agent 装进同一个体系,并跑出更复杂、更稳定的任务流程。

GitHub 发布地址:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8

信源