桃子桃子快讯
返回首页
工具

Mirrors:为 AI 智能体构建可回放的预发布环境

Mirrors 通过回放历史会话在合并前捕捉 AI 智能体回归,原生集成 LangChain、LangGraph、Ope…

2026.07.30 · 周四3 分钟阅读

Mirrors 是一个面向 AI 智能体的预发布测试平台,核心思路是为智能体运行所需的外部系统构建一套"可运行副本",再把真实会话重放到该环境中,从而在代码合并或上线前发现回归,而不是让真实用户先撞上 bug。

产品要解决的问题

AI 智能体在生产环境中会调用一系列外部工具与数据接口(订单系统、支付接口、CRM 等)。当智能体代码、提示词或底层模型发生变化时,传统单元测试难以覆盖多步、多工具的复杂链路。Mirrors 把生产环境中的"一次完整会话"作为测试用例:同一个用户的请求,分别在旧版本与新版本智能体上各跑一遍,比对差异。原文给出的示例中,旧版本对一笔订单退款一次(420 美元),新版本却退款两次(840 美元),问题在 staging 阶段就被捕获,不会出现在真实用户面前。

环境如何被构建

Mirrors 不依赖生产流量即可生成测试环境,主要依赖三类输入:trace 导出、智能体代码、工具代码或文档。其内部从这些来源挖掘出 schema、种子数据与工具行为,并打包成可运行的副本环境,包含那些通常拿不到测试实例的内部工具。环境就绪后,每一次 pull request 都会触发自动回放,对历史会话做回归检测。环境运行在虚构数据上,工具与真实系统行为一致,但不会暴露真实客户信息。

集成与生态

平台以原生或近原生方式对接主流智能体框架与模型供应商 SDK,包括:

  • LangChain、LangGraph
  • OpenAI 与 Anthropic(Claude)SDK
  • Cursor、Codex、Windsurf 等编码智能体
  • Model Context Protocol(MCP),通过 claude mcp add 一行命令接入

Collector 仅需两行代码即可启用,自动为 Python、TypeScript、Go 注入埋点;其他语言可通过一次手动调用接入 trace。LangGraph 已支持,更多运行器正在添加。Replay 页面会将每一条生产调用与回放环境中的对应调用做 diff,标注一致与偏离的位置,便于在合并前审视风险。

定价与使用方式

免费层每月提供 60 分钟回放额度,超出后按 $0.20 / 回放分钟计费,不限环境数量,并提供 CI 网关与公共 /v1 API,无座位许可与锁定。Enterprise 层面向规模化团队,提供批量折扣、SSO 与角色控制、安全评审与本地化(On-prem / BYOC)部署选项,定价为定制。

整体来看,Mirrors 把传统软件工程中的"回放测试 + staging 环境"思路移植到 AI 智能体场景,填补了智能体上线前缺乏可信预发布验证的空白,对正在搭建生产级智能体应用的工程团队具有一定参考价值。

信源