桃子桃子快讯
返回首页
产品功能

AWS Bedrock AgentCore 上线跨框架智能体评估能力

AWS Bedrock AgentCore 新增 Evaluations 功能,通过 OpenTelemetry 标准化…

2026.08.27 · 周四5 分钟阅读

Amazon Web Services 在 Amazon Bedrock AgentCore 中推出 Evaluations(评估)能力,借助 OpenTelemetry 标准化协议,将智能体评估与底层框架解耦,使 LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDK、Strands Agents 等主流框架构建的智能体均可通过同一套评估器进行评测。

背景:智能体框架多样化与评估工具缺位

当前 AI 团队在构建生产级智能体时,面临一个不对称局面:智能体框架日益多样,但评估工具未能同步跟进。多数评估系统预设了特定 SDK、特定大模型客户端和特定追踪模式,一旦脱离这套约定,评估管道便会失效。AWS 在博文中列举了团队常见的选型路径——看重工作流编排的团队选择 LangGraph,需要紧密集成检索管线的团队选择 LlamaIndex,组织内部统一使用 GPT 模型的团队采用 OpenAI Agents SDK,需要多智能体协调的团队使用 Google ADK,依赖 Anthropic 原生能力的团队则采用 Claude Agent SDK,希望快速启动的团队则借助 Strands Agents 在数分钟内于 AgentCore 上跑通一个工作智能体。上述框架均运行在 AgentCore Runtime 之上,由后者统一托管扩展、内存与可观测性基础设施。

核心思路:以 OpenTelemetry 作为通用语言

AgentCore Evaluations 的核心解法是借助 OpenTelemetry 这一中立观测框架,把评估能力从框架选型中解耦出来。只要智能体的遥测数据通过 OpenTelemetry 输出,无论底层采用何种 SDK,评估服务均可对其打分。

在 AgentCore Runtime 上,遥测数据由 AWS Distro for OpenTelemetry(ADOT)采集,并通过 OpenTelemetry 协议(OTLP)上报至 Amazon CloudWatch。OpenTelemetry 的 trace 由一组 span 构成,每个 span 代表请求中的一个工作单元。一次智能体执行可能产生多种 span,覆盖模型调用、工具调用、文档检索、重排序、嵌入生成、护栏检查、提示模板渲染、内存读写及编排步骤等。两个主流约定将这些操作显式化:

  • OpenTelemetry GenAI 约定定义 chat、embeddings、retrieval、execute_tool、invoke_agent、create_agent、plan 等操作以及内存操作族。
  • OpenInference 定义 LLM、TOOL、RETRIEVER、RERANKER、EMBEDDING、AGENT、CHAIN、GUARDRAIL、EVALUATOR、PROMPT 等 span 类型。

一次生产 trace 通常会混合多种类型。

评估依赖的三类核心 span

评估服务仅需三类 span 即可重构会话过程并完成打分,其余 span 仅作为补充上下文:

  • invoke_agent span:代表顶层请求-响应周期,即一次用户轮次,承载用户提示词与智能体最终回复。
  • inference span:代表一次模型调用,承载传入模型的消息历史与模型回复。
  • execute_tool span:代表智能体调用的每个工具,承载工具名称、输入参数与结果。

服务对接收到的每个 span 进行分类,从上述三类角色中读取所需字段并跳过其余内容。携带检索、重排序、护栏或内存 span 的更丰富 trace 无需特殊配置,这些 span 仅提供评估器不依赖的上下文。不同框架与插桩库在属性名、嵌套结构和 span 命名约定上存在差异,OpenTelemetry GenAI 语义约定与 OpenInference 规范虽都覆盖上述三类 span,但属性键与 span 词汇不同——AgentCore Evaluations 在底层桥接两套规范,统一输出评估结果。

评估流程与可用评估器

当用户触发评估(按需运行或通过在线评估配置)时,评估服务从 CloudWatch 拉取智能体的 span 与事件记录,按 session.id 聚合为会话,每个 trace_id 对应一次用户轮次。服务完成 span 分类与字段抽取后,将重构后的会话交给评估器打分。此后的评估过程完全与框架无关,统一的评估器对所有框架一视同仁,包括:

  • GoalSuccessRate(目标达成率)
  • Correctness(正确性)
  • Helpfulness(有用性)
  • 自定义 LLM-as-a-judge 评估器

由于评估逻辑仅依赖三类 span 的识别,方案对新出现的 span 类型天然向前兼容:未识别的 span 类型会被跳过而非报错,使整体能力可随框架与规范演进而平滑扩展。

信源