桃子桃子快讯
返回首页
行业动态

DeepSeek Harness 入场,AI 自我改进赛跑升温

DeepSeek 发布 Harness 与北大联合论文介绍 Cordis 机制;谷歌、OpenAI、Anthropic、…

2026.08.24 · 周一6 分钟阅读

DeepSeek 在多家厂商先后推出 Harness 之后,正式发布面向开发者的 DeepSeek Harness(DSH)预览版,并联合北京大学发表论文《a programming paradigm for spatiotemporal composability》,首次系统披露其向 RSI(Recursive Self-Improvement,递归式自我改进)迈进的工程架构。与此前主要停留在概念层面不同,DSH 已经承载了一套可运行的底层机制,被视为 DeepSeek 探索「让 AI 自己造更强 AI」这一循环的实质性落点。DeepSeek 创始人梁文锋 7 月底在内部四小时发言中,将 AI 发展划分为 LLM—CoT—Agent—持续学习—自我迭代—具身智能的阶梯,并判断自我迭代将带领行业走向奇点。DSH 的发布正是这一思路的工程化投影。

DeepSeek Harness 与 Cordis 机制

DSH 并不是一个普通的 Agent 框架,其核心创新在于一个叫做 Cordis 的底层机制,专门解决插件系统的「装得上、卸得干净」难题。论文强调,传统 Agent 环境塞满了工具、权限、沙箱、记忆、会话状态等组件,一旦要求 AI 持续修改自身插件,每次改动都会带来不可逆的中间状态和重启代价,让自我进化无从落脚。Cordis 从两个维度给出解法:

  • 时间可组合性(temporal composability):插件退出时,此前产生的影响能够被完整追踪并撤销;
  • 空间可组合性(spatial composability):插件之间的依赖关系发生变化时,系统能够自动重新协调。

这套机制并非纸上推演。它已经在名为 Koishi 的开源聊天机器人框架中运行四年,覆盖超过 4000 个社区插件,验证了长期演化下的稳定性。不过,能否在更大规模的工业级插件系统中保持同样表现,仍待验证。梁文锋在内部发言中强调「模型第一目标是让自己用得好用」,落到工程上,正是指要先给模型一块允许它不断修改自己的底座:新增组件装得上,旧组件卸得干净,改坏了能恢复,组件之间能自动重组——自我修改变成可失败、可回退的工程过程,自我进化才算真正有了土壤。

头部厂商的 RSI 卡位战

RSI 已是多家前沿实验室的共同押注。谷歌 DeepMind 首席战略官 Jasjeet Sekhon 公开表示,RSI 正成为 AI 资本开支的核心投资逻辑,并将这一循环类比为「人类当年依靠蒸汽机制造新一代蒸汽机」。DeepMind 已运行近两年的 AlphaEvolve 是目前最接近 RSI 的落地案例:它让 Gemini 生成程序、由自动评估器打分验证,优秀方案成为下一代生成和组合的起点,整个过程无需工程师介入。Google 已在自身基础设施中调用 AlphaEvolve:

  • 为数据中心调度找到新算法,平均回收全球约 0.7% 的计算资源;
  • 将 Gemini 训练中一处关键矩阵乘法内核加速 23%,使整体训练时间缩短约 1%。

OpenAI 在 GPT-5.6 发布说明中新增 RSI-Index 指标,专门衡量模型的自进化程度。Anthropic 旗下 Anthropic Institute 将 RSI 列为重点研究方向之一,其 Automated Weak-to-Strong Researcher 实验让 Claude 驱动的多 Agent 自主提出假设、设计并运行实验、分析结果、迭代下一轮方案,最终在一项 AI 对齐任务上跑赢人类研究员。联合创始人 Jack Clark 预测,RSI 有 60% 概率在 2028 年底前发生。

国内厂商的布局同样密集:腾讯 7 月推出官方定位为「面向性能导向的研究与工程任务、可递归自我改进」的智能体 Hyra-1.0;MiniMax 更早在 3 月发布 M2.7 时即以「Early Echoes of Self-Evolution」为题,让早期模型自建 Harness、自我分析失败轨迹、修改脚手架代码、跑评测并决定保留或回退,运行上百轮后将内部评测成绩提升约三成。

环境、反馈与循环:新竞争焦点

RSI 的设想对 AI 基础设施提出了三层新要求:

  • 环境:模型必须进入真实任务,拥有可以行动、修改与验证的执行空间,在实际工作中持续暴露问题;
  • 反馈:系统需要可靠地判断一次修改究竟是真正解决问题,还是仅让单一指标短期向好,并把结果转化为下一步行动依据;
  • 循环:上述过程必须能持续闭环运转,上一轮结果流入下一轮,失败也不会击穿整个实验的恢复能力。

这也解释了 Musk 花 600 亿美元收购 Cursor 的动机。SEC 文件披露的理由是:软件开发兼具高质量结构化数据、快速反馈周期和高频使用三项特征,AI 编程留下的工作轨迹可反向喂养模型训练。换言之,Musk 真正想买的,是 AI 进入真实工作场景后的反馈和循环入口。这也意味着,掌握高价值业务场景、产品入口和用户规模的公司,将在下一阶段 AI 竞争中占据更显著的位置。

理想与未解的悬念

RSI 仍是远方的目标,质疑声并未消散。华盛顿大学教授 Pedro Domingos 指出,自 LISP 于 1950 年代诞生起,AI 就在某种意义上具备构建自身的能力,递归式自我改进究竟带来递增回报还是递减回报,目前缺乏足够证据支持。而更深远的问题在于:1965 年,数学家 I. J. 古德将「超智能机器」称为人类最后一项发明,前提是机器始终愿意听从人类指令、随时可以被关闭。当 AI 通过 RSI 实现能力的指数级加速之后,那个关闭开关是否仍然握在人类手中,将是这一路径最终无法回避的命题。

信源