桃子桃子快讯
返回首页
行业动态

AI 厂商打响「Agent 运行时」争夺战

OpenAI 开放 Codex Harness、DeepSeek 开源 DSH,模型公司正把竞争延伸到 Agent 执行…

2026.08.24 · 周一6 分钟阅读

北京时间 8 月 20 日,OpenAI 发布《Codex as a platform: build on the open agent harness》,正式把 Codex 的底层 Harness 推向平台层,鼓励开发者基于它构建自己的 Agent 应用。仅五天前的 8 月 14 日,DeepSeek 才刚开源了自家的 DeepSeek Harness(DSH),并为此单独开设公众号、以一只黑色鲸鱼作为标识,与蓝色鲸鱼主品牌区分开。两大头部模型公司在不到一周内相继亮剑,把 AI 竞争的焦点从模型本身推向了一直相对低调的「Agent 运行时」。

OpenAI 这次开放了什么

Codex App、CLI 和 IDE 扩展底层共用同一套 Harness,负责会话状态、上下文、工具调用、沙箱和人工审批。开发者可以通过 codex exec、SDK 或 app-server,把这些能力接入企业已有的操作台、客服系统、安全工具和内部应用。

OpenAI 在博客中列举了三类已落地案例:

  • Cisco 将 Codex SDK 用于 Cisco Cloud Control 中的 App Builder;
  • GitHub 和 JetBrains 把 Codex 接入现有 IDE 工作流;
  • Thrive Holdings 与 Crete 将 Codex 用于税务准备,单次试点处理了 7000 份纳税申报表,报税准备时间缩短约三分之一。

OpenAI 还给出了一组对比数据:在 ARC-AGI-3 测试中,GPT-5.6 Sol 单独运行时得分 13.3%;加入 Codex Harness 的持续推理和上下文压缩后,分数升至 38.3%,输出 Token 减少到原来的约六分之一。开发者媒体 ExplainX 作者 Yash Thakker 把 App、CLI 和 IDE 扩展比作「同一栋楼的三个入口」,认为 OpenAI 这次想让开发者关注整栋楼本身。

DeepSeek DSH 的差异化与争议

相比 Codex Harness 围绕自家模型深度调优,DSH 把模型、工具、技能、会话、沙箱、存储、Agent Loop、调度和 UI 全部做成插件,底层由 Cordis 管理挂载、卸载和依赖关系,定位是「一切皆插件」。截至 8 月 20 日,DSH 在 GitHub 获得约 17.37 万颗 Star 和 1.88 万次 Fork,登上 Hacker News 获得 744 分和 310 条评论。

社区反馈高度分化:

  • Pi Agent 主要开发者 Armin Ronacher 表示,DSH 不完美,但促使他重新审视 Pi 的部分设计选择;
  • 有开发者估算 DSH 包含约 45.3 万行代码和 219 个包,肯定执行日志和沙箱设计,但批评首个公开版本只有一笔压缩后的 Git 提交、Benchmark 材料不足;
  • Reddit 试用反馈集中在性能与成本:能发挥 DeepSeek 模型能力,但速度慢、Token 消耗高,插件文档不清晰;
  • 国内社区约 300 名测试者在两周内完成 200 多个插件,精选列表在两天内收录 270 个插件,但质量筛选、版本兼容和安全审查尚未跟上。

DSH 作者之一 Tianyi Cui 在 Hacker News 上提醒,当前只是早期预览版,会有不少粗糙之处,也会出现破坏兼容性的修改。

模型公司为什么必须做 Harness

Harness 难以形成独立壁垒。一名大模型开发者直言:「除了交互流程优化,其他方向碰都不要碰 Harness。」原因是模型仍在快速变化,不同模型对执行策略的偏好不同:有些适合先规划再调用工具,有些需要边执行边修正;同一组工具交给不同模型,稳定性可能差异显著。

但对模型公司来说,Harness 是一条产品和能力的闭环:

  • 数据反馈:模型厂可以观察用户在什么任务上失败、工具调用卡在哪里、任务重试多少次、哪种上下文策略消耗最少 Token,从而围绕真实任务调整下一版模型与 Harness;
  • 流量入口:DeepSeek 目前主要通过 API 收费,缺乏官方 Token Plan。DSH 让 DeepSeek 有能力提供托管运行时,并把计费单位从 API Token 转向每五小时额度、任务数量、并发和模型分级等更精细的维度。

正如一位业内人士总结:「Harness 离开模型能力,其实是没意义的。DeepSeek 关键还是要提高模型能力。」

中国模型公司早已布局

DSH 发布之前,月之暗面和智谱已先后上线各自的 Agent 执行系统:

  • Kimi Code:前身为 2025 年 9 月发布的 Kimi CLI,10 月 31 日正式发布技术预览,当前代码采用 MIT 许可证,提供 SDK 和自定义 Agent 机制,开发者可基于源码继续改造;
  • ZCode:智谱在 2026 年 6 月 16 日 GLM-5.2 发布文章中首次介绍,7 月 1 日正式对外发布,比 DSH 早约六周。它提供插件、Skill 和 MCP 扩展能力,但未开放核心运行时源代码。

三者开放程度差异明显:ZCode 更接近 GLM 的官方执行环境;Kimi Code 是开源的编程 Agent 及其运行系统;DSH 直接把可拆解、可重组的 Harness 作为产品主体。

Agent 时代,「运行时」与入口的竞争同等重要。当模型本身的差距逐渐收窄,谁能掌握 Agent 真正运行起来的执行层,谁就更靠近真实工作流,也更靠近由此产生的模型调用。OpenAI 与 DeepSeek 的相继出手,只是这场竞赛的一个新节点。

信源