桃子桃子快讯
返回首页
行业动态

AI Agent Harness 评估困境:基准分数之外还缺什么

作者指出 Agent 周围的提示词、工具、记忆与路由系统日益自主可变,传统基准测试难以判断其真实改进,提出 Retent…

2026.08.29 · 周六4 分钟阅读

随着大模型驱动的智能体(Agent)走向真实业务场景,越来越多人意识到:决定 Agent 实际表现的,并不只有模型本身,而是其周围的「harness」——一套由提示词、工具、记忆、上下文、模型路由、重试、评估器、子智能体、权限与编排逻辑共同组成的支撑系统。Flamelit 团队在近期一场 AI Adoption 主题会议上分享的思考,正是围绕这一层系统该如何评估展开。

什么是 Agent Harness

在主流讨论中,模型权重往往被视为智能体的全部,但越来越多一线团队意识到,模型只是 Agent 的一部分,harness 才是真正决定能力边界的地方。它通常包含:

  • 提示词与运行指令;
  • 工具调用与权限;
  • 长期 / 短期记忆;
  • 上下文管理与压缩;
  • 模型路由(按任务选不同模型);
  • 子智能体的生成与协调;
  • 评估器与重试机制。

更关键的是,harness 已经不再是静态配置。一个 Agent 可能改写自己的提示词、增删记忆、切换底层模型,甚至生成由其他模型驱动的子智能体。这种「自我修改」特性,让传统的基准测试开始显得力不从心。

基准分数为何会误导我们

最直觉的评估方式,是在 harness 改动前后跑一遍 benchmark:如果分数上升,就视为「变好了」。但作者指出,这种判断很容易掩盖真实问题,例如:

  • 记忆策略调整让 benchmark 提升 5%,却丢失了 benchmark 之外某一类问题的处理能力;
  • 模型路由切换后平均性能更好,但在某类关键任务上的稳定性显著下降;
  • 上下文压缩更高效,却在几步之后丢掉后续步骤需要的信息。

换言之,benchmark 报告「系统变好了」,但业务实际感受到的可能是回归。软件工程曾通过回归测试、可观测性、受控发布等手段应对类似问题;而 Agent 系统让这件事变得更难,因为被测试的对象本身正在修改决定其未来行为的机制。

Retention / Loss / Gain:一个三维分析框架

作者正在探索的方向,是把「这次改动到底让 Agent 发生了什么」拆成三个维度:

  • Retention(保留):新版本是否仍然具备此前已被验证的能力与区分能力;
  • Loss(损失):哪些原本可观察的行为消失或退化;
  • Gain(增益):真正出现了哪些此前不具备的新行为或新能力。

基准分数在这一框架下仍然有用,但它的角色从「判断好坏」转向「区分改动」:两个版本的分数差异,并不等同于系统的真实状态差异。作者还提到,经济学与决策论中 Blackwell 的信息理论——一种比较两个信息结构是否保留关键区分能力的方法——可能为 Agent harness 的对比提供形式化基础。

对工程师与企业的现实意义

对工程团队而言,这套思路指向一种「面向自修改 Agent 的回归测试」:一次 harness 更新不仅要跑赢既有 benchmark,还要证明它没有悄悄摧毁既有能力。具体可落到以下几类改动:

  • 记忆压缩策略;
  • 上下文裁剪;
  • 模型路由;
  • 提示词演化;
  • 工具选择;
  • 子智能体架构;
  • harness 的自主修改本身。

对正在部署 Agent 的企业来说,问题更偏向治理与合规。当系统可以自行改变运行方式,「冻结版本」就不再是治理选项,治理将变成「能否判断每一次变化是否真正改善了系统」。作者认为,能够回答「是真的改善了,还是只是在我们盯着的指标上改善了」的度量框架,将成为 Agent 进入生产环境的关键基础设施。

信源