桃子桃子快讯
返回首页
行业动态

自改进 AI 智能体:热度之下,真正在生产里跑通的并不多

行业分析指出,自改进循环的关键在验证器与真实数据反馈;多数所谓自改进案例仍依赖人工专家标注,自动评测存在标准漂移风险。

2026.07.23 · 周四3 分钟阅读

「自改进 AI 智能体」是近期业界最热的话题之一,但作者在调研 9 个公开案例后直言:真正能在生产环境里闭环运行的「自改进」实例「寥寥无几」。文章认为,自改进循环能否成立,几乎完全取决于其中的「验证器」(verifier),而验证器又取决于真实世界数据的供给质量。

自改进循环的三段式结构

作者将一个标准的自改进循环拆成三个组件:

  • 执行循环:智能体实际完成的工作,例如监听 bug 队列并修复;
  • 验证器:对照既定标准检验执行结果;
  • 反馈机制:把验证器标记出的问题回灌到执行循环中重跑。

瓶颈集中在验证器。若验证器没有稳定、真实的现实数据支撑,循环就可能在「随机方向」上优化。代码类场景相对容易——测试通过/失败、生产遥测、代码历史、灰度实验、用户反馈与 bug 队列都可以作为数据源;但一旦进入知识工作,「真实数据从哪里来」就需要相当多的创造力。

两个被验证的生产案例

Replit 的产品开发 Agent。 流程是智能体识别产品问题、写代码并提交构建,随后由验证器接手:先用 Replit 专门为「氛围编程」设计的基准模拟运行应用与用户点击;通过后再走 A/B 测试,最后由人审核决定上线、迭代或放弃。文中特别提到 Replit 自研的 Telescope 工具,能在不暴露用户数据的前提下对调用轨迹进行聚类分析。

OpenAI FDE 与 Thrive 合作的税务 Agent。 税务准备涉及成百上千份文档,是 CPA 最耗时的环节。Agent 上线后,OpenAI 前线部署工程师(FDE)持续把生成结果交给 CPA 逐字段比对,要求专家解释「哪些判断与智能体不同、为什么」。六周内,草稿至少 75% 正确的比例从约 25% 提升到 86%。

自动评测是一匹「特洛伊木马」

作者警告,依赖自动评测搭建的循环看似便宜、迅速、隐私友好,但 ML 工程师 Hamel Husain 的开放测试已表明:自动评测在「已知标准」上表现尚可,一旦遇到「定义模糊」的边界场景,就会出现标准漂移,最终「客户哭泣、预算流失」。对于知识工作类智能体,能否让失败可观察、可解释,并说服专家就足够多的失败样本给出反馈,可能是当下 AI 落地的最大瓶颈之一。

给项目发起者的两个问题

作者在结尾给希望投资自改进项目的团队提出两条对齐资源的提问:

  • 哪些真实数据在为验证器提供支撑?
  • 谁来为失败案例提供专家反馈,代价是多少?

在他看来,这两个问题的答案,往往比模型本身更能决定一个自改进智能体项目能否真正落地。

信源