桃子桃子快讯
返回首页
工具

AWS 联合 Motorway 发布 AI 智能体生产级评估蓝图

AWS 与英国二手车平台 Motorway 合作,基于 Strands SDK 与 Bedrock AgentCore…

2026.07.24 · 周五4 分钟阅读

AWS Machine Learning 博客近日发布与英国线上二手车平台 Motorway 及 AWS Prototyping and AI Customer Engineering(PACE)团队联合撰写的案例文章,详细介绍了如何为生产环境中的 AI 智能体(Agent)构建一套端到端的评估体系。该方案基于 Strands Agents SDK 与 Amazon Bedrock AgentCore,将原本依赖人工筛选的工作流改造为自然语言驱动的智能检索,错误率从 1/8 显著下降到 1/50,问题检出时间也从数小时压缩到分钟级。

业务背景与核心挑战

Motorway 运营每日拍卖业务,高峰期有约 8,000 家经销商参与竞拍 2,500 辆车辆。引入 AI 智能体后,经销商可直接用自然语言查询库存,例如「5 年内的汽油、混动和纯电车型」或「家用的运动型自动挡车」,由智能体在 89 项车辆属性上完成结构化过滤与向量相似度检索。

由于涉及真实交易与高并发(约 1,500 并发用户),智能体一旦出错将直接损害用户信任。文章归纳出四类典型问题:

  • 工具选择错误导致检索结果失准;
  • 语义搜索误读,把多约束查询解析错误;
  • 多轮对话中的上下文漂移,丢失用户细化条件;
  • 输出非确定性,使得单次测试难以可靠反映真实表现。

解决方案:三部分组成的评估流水线

文章给出的方案由三个相互衔接的部分组成:

  • 两阶段评估策略:构建期使用开源库 strands-agents-evals 进行测试,生产期切换到 Amazon Bedrock AgentCore Evaluations 做持续监控;
  • 三层评估框架:分别评估工具使用、推理过程与输出质量;
  • 五阶段部署流水线:通过质量门禁(quality gates)在指标不达标时阻断发布。

文章强调,虽然整套蓝图依赖 AWS 服务,但其核心理念(分层评估、使用 pass^k 指标衡量一致性)是面向任何生产级智能体的通用要求。配套仓库提供了可直接部署的参考实现。

案例:经销商库存搜索智能体

该智能体通过 Strands Agents SDK 构建并部署在 AgentCore Runtime 上,对外暴露 8 个工具,结合结构化过滤与基于 LanceDB、Amazon Titan Text Embeddings V2 的向量检索。其请求链路为:经销商通过 Web 界面提交自然语言查询 → AgentCore Runtime 编排 → 调用 Claude(推理)与 Titan Embeddings(向量化)→ 8 个工具返回结果 → 最终生成面向经销商的答复。

相较于此前经销商需要手动筛选 CSV 与僵硬过滤器的工作方式,新方案把交互变为对话式查询,显著降低了使用门槛。

为什么智能体评估不同于 LLM 评估

文章专门用一节区分了两类评估的目标差异:LLM 评估关注文本生成质量(连贯性、事实性、相关性),而智能体评估关注的是「整辆车在真实路况中如何行驶」,包括多步工作流的完成度、工具调用正确性、推理连贯性、一致性、安全合规与成本效率。

文章列出的关键评估维度包括:任务完成率、工具使用正确性、推理连贯性、可靠性与一致性、安全与合规、成本与效率。文中以查询「Volkswagen Golf 7-12 years old」为例说明精确查询与口语化变体之间的表现差异,并指出传统 LLM 指标无法衡量智能体是否选对了搜索工具、是否向 LanceDB 传入了正确的过滤参数,以及多轮对话中前序条件是否被正确继承。

部署与成本说明

按文章给出的前置条件,完成初始部署约需 30–45 分钟,按业务场景定制需 2–3 小时。运行示例评估套件在 Amazon Bedrock 上的推理费用约为 5–10 美元,生产监控成本则取决于采样率。安全方面,配套仓库使用最小权限 IAM 角色,将 API 密钥存放在 AWS Systems Manager Parameter Store 中,并通过类型化参数降低注入风险。

信源