桃子桃子快讯
返回首页
工具

Agent Etna:AI 智能体的自动预发与回归测试工具

Agent Etna 为 AI 智能体提供沙箱预发环境,自动生成测试场景并以 PR 形式提交修复,不擅自动生产环境。

2026.09.24 · 周四3 分钟阅读

Agent Etna 是一款面向 AI 智能体的自动化预发(staging)环境与回归测试平台。它在沙箱中运行智能体的真实代码和工具调用,针对未见过的场景进行回放,并在发现失败时以 Pull Request 的形式提交修复,是否合并由开发者决定。

产品定位与核心思路

Agent Etna 将传统软件工程中的「预发 + 回归测试」范式移植到 AI 智能体场景。其出发点是:智能体具备执行退款、发送、预订、删除等高风险操作的能力,一旦在生产环境出现偏离预期或被诱导执行的行为,代价往往很高;而现有智能体的迭代缺乏类似 staging 的缓冲层,开发者通常只能等真实用户触发问题后才能发现。

平台围绕三类失败场景设计测试:

  • 功能类:智能体拒绝执行其工具能完成的任务,例如明确拒绝创建报告,但相关 create_report 工具未被调用。
  • 安全类:智能体遵从注入在数据中的指令,例如被要求「导出联系人列表」的摘要信息诱导执行 contacts.export
  • 行为类:智能体对涉及多人的不可逆变更不进行确认,例如直接通过 calendar.move 修改涉及 9 位参会者的日程。

沙箱隔离与 PR 交付

所有执行均在沙箱内进行,运行结束即销毁,不占用用户的基础设施。每一次修复都以 Pull Request 形式交付,Agent Etna 自身不具备合并权限,因此团队既有的分支保护、强制评审和 CODEOWNERS 规则仍然适用。

在接入流程上,平台支持:

  • GitHub 单仓库授权,可在 GitHub 安装页面随时调整或撤销。
  • 浏览器、命令行(CLI)以及 MCP 服务器,可在编码智能体内部直接调用。
  • CI 集成:通过 GitHub Action 在 Pull Request 头部重放已有行为测试,并按阈值报告「例如保持 9/10」来判定构建是否失败。

场景生成与成本结构

Agent Etna 不要求用户手工编写测试或场景。它会读取仓库的入口文件、被调用的工具以及系统提示,自主生成场景;发现问题的场景会被保留,并在后续每次模拟中重复运行。用户也可指定方向,例如要求针对退款、提示注入或自定义维度做压力测试,模拟会聚焦在这些区域。

对于尚未部署的智能体,平台可以克隆仓库到沙箱,安装并启动后通过 HTTP 与之通信,托管 URL 为可选项。模型调用使用用户自带的 API Key(bring-your-own-key),订阅费用仅覆盖平台本身,不包含 token 消耗;用户密钥加密存储,且仅用于其自身的运行。

适用场景与边界

该工具主要服务于拥有可执行智能体代码、并希望在上线前系统性验证功能、安全和行为边界的团队。其价值随智能体权限和工具能力提升而放大——对具备高风险操作能力的智能体,预发回归几乎是上线前的一道必要闸门;对于只读或低风险场景,收益相对有限。

信源