AI 厂商打响「Agent 运行时」争夺战
OpenAI 开放 Codex Harness、DeepSeek 开源 DSH,模型公司正把竞争延伸到 Agent 执行…
北京时间 8 月 20 日,OpenAI 发布《Codex as a platform: build on the open agent harness》,正式把 Codex 的底层 Harness 推向平台层,鼓励开发者基于它构建自己的 Agent 应用。仅五天前的 8 月 14 日,DeepSeek 才刚开源了自家的 DeepSeek Harness(DSH),并为此单独开设公众号、以一只黑色鲸鱼作为标识,与蓝色鲸鱼主品牌区分开。两大头部模型公司在不到一周内相继亮剑,把 AI 竞争的焦点从模型本身推向了一直相对低调的「Agent 运行时」。
OpenAI 这次开放了什么
Codex App、CLI 和 IDE 扩展底层共用同一套 Harness,负责会话状态、上下文、工具调用、沙箱和人工审批。开发者可以通过 codex exec、SDK 或 app-server,把这些能力接入企业已有的操作台、客服系统、安全工具和内部应用。
OpenAI 在博客中列举了三类已落地案例:
- Cisco 将 Codex SDK 用于 Cisco Cloud Control 中的 App Builder;
- GitHub 和 JetBrains 把 Codex 接入现有 IDE 工作流;
- Thrive Holdings 与 Crete 将 Codex 用于税务准备,单次试点处理了 7000 份纳税申报表,报税准备时间缩短约三分之一。
OpenAI 还给出了一组对比数据:在 ARC-AGI-3 测试中,GPT-5.6 Sol 单独运行时得分 13.3%;加入 Codex Harness 的持续推理和上下文压缩后,分数升至 38.3%,输出 Token 减少到原来的约六分之一。开发者媒体 ExplainX 作者 Yash Thakker 把 App、CLI 和 IDE 扩展比作「同一栋楼的三个入口」,认为 OpenAI 这次想让开发者关注整栋楼本身。
DeepSeek DSH 的差异化与争议
相比 Codex Harness 围绕自家模型深度调优,DSH 把模型、工具、技能、会话、沙箱、存储、Agent Loop、调度和 UI 全部做成插件,底层由 Cordis 管理挂载、卸载和依赖关系,定位是「一切皆插件」。截至 8 月 20 日,DSH 在 GitHub 获得约 17.37 万颗 Star 和 1.88 万次 Fork,登上 Hacker News 获得 744 分和 310 条评论。
社区反馈高度分化:
- Pi Agent 主要开发者 Armin Ronacher 表示,DSH 不完美,但促使他重新审视 Pi 的部分设计选择;
- 有开发者估算 DSH 包含约 45.3 万行代码和 219 个包,肯定执行日志和沙箱设计,但批评首个公开版本只有一笔压缩后的 Git 提交、Benchmark 材料不足;
- Reddit 试用反馈集中在性能与成本:能发挥 DeepSeek 模型能力,但速度慢、Token 消耗高,插件文档不清晰;
- 国内社区约 300 名测试者在两周内完成 200 多个插件,精选列表在两天内收录 270 个插件,但质量筛选、版本兼容和安全审查尚未跟上。
DSH 作者之一 Tianyi Cui 在 Hacker News 上提醒,当前只是早期预览版,会有不少粗糙之处,也会出现破坏兼容性的修改。
模型公司为什么必须做 Harness
Harness 难以形成独立壁垒。一名大模型开发者直言:「除了交互流程优化,其他方向碰都不要碰 Harness。」原因是模型仍在快速变化,不同模型对执行策略的偏好不同:有些适合先规划再调用工具,有些需要边执行边修正;同一组工具交给不同模型,稳定性可能差异显著。
但对模型公司来说,Harness 是一条产品和能力的闭环:
- 数据反馈:模型厂可以观察用户在什么任务上失败、工具调用卡在哪里、任务重试多少次、哪种上下文策略消耗最少 Token,从而围绕真实任务调整下一版模型与 Harness;
- 流量入口:DeepSeek 目前主要通过 API 收费,缺乏官方 Token Plan。DSH 让 DeepSeek 有能力提供托管运行时,并把计费单位从 API Token 转向每五小时额度、任务数量、并发和模型分级等更精细的维度。
正如一位业内人士总结:「Harness 离开模型能力,其实是没意义的。DeepSeek 关键还是要提高模型能力。」
中国模型公司早已布局
DSH 发布之前,月之暗面和智谱已先后上线各自的 Agent 执行系统:
- Kimi Code:前身为 2025 年 9 月发布的 Kimi CLI,10 月 31 日正式发布技术预览,当前代码采用 MIT 许可证,提供 SDK 和自定义 Agent 机制,开发者可基于源码继续改造;
- ZCode:智谱在 2026 年 6 月 16 日 GLM-5.2 发布文章中首次介绍,7 月 1 日正式对外发布,比 DSH 早约六周。它提供插件、Skill 和 MCP 扩展能力,但未开放核心运行时源代码。
三者开放程度差异明显:ZCode 更接近 GLM 的官方执行环境;Kimi Code 是开源的编程 Agent 及其运行系统;DSH 直接把可拆解、可重组的 Harness 作为产品主体。
Agent 时代,「运行时」与入口的竞争同等重要。当模型本身的差距逐渐收窄,谁能掌握 Agent 真正运行起来的执行层,谁就更靠近真实工作流,也更靠近由此产生的模型调用。OpenAI 与 DeepSeek 的相继出手,只是这场竞赛的一个新节点。
