AWS Strands Evals 与 Bedrock AgentCore 推出技能专用评估器
AWS 在 Strands Evals 与 Bedrock AgentCore 中新增三项针对智能体技能的评估指标,用于…
AWS 近期在其官方 Machine Learning 博客中介绍了 Strands Evals SDK 与 Amazon Bedrock AgentCore Evaluations 的新能力:三项专门针对「技能(Skill)」的评估器,用于检测通用智能体在调用业务专用技能时常见的两种失败模式。
背景:从单一提示到模块化技能
通用智能体虽然能覆盖广泛任务,但在合规审查、文档处理、升级策略、工程规范等业务场景中,往往需要严格遵循既定流程。把所有规则塞进系统提示或应用层逻辑,会让维护与更新变得困难。AWS 提出的解法是引入「技能」概念:一个可复用的指令集合,通常存放在 SKILL.md 文件中,教会智能体完成某个领域任务,例如合同脱敏、发票核对或团队 PR 规范。
技能遵循开放的 Agent Skills 标准,具备跨兼容运行时可移植的特性,智能体在运行时按需加载所需技能,而不是把所有流程都装进核心指令。一个技能通常打包以下要素:
- 指令:注入到智能体上下文中的领域指导与约束;
- 工具绑定:技能依赖的 API、MCP 服务器或本地命令;
- 知识:参考资料与示例;
- 工作流:多步骤流程或决策逻辑;
- 护栏:格式要求、范围限制与校验规则。
这种模块化方式有助于团队更快地专业化智能体、跨智能体和工作流复用经过验证的流程、保持行为一致,并在不微调底层模型的前提下更新领域指导。
两类易被忽视的失败模式
技能可组合性带来了两类传统输出质量指标难以捕获的失败:
- 智能体调用了不适合当前任务的技能;
- 智能体虽然选对了技能,却跳过或只部分遵循了技能指令。
两种失败都可能产生流畅且看似合理的回答,但并未真正使用预设的领域知识。因此,单看最终响应无法判断是否执行到位,必须基于完整轨迹进行评估。
新增的三项技能评估器
为解决上述问题,Strands Evals 与 Bedrock AgentCore Evaluations 引入了三个技能评估器:
- Skill Selection Accuracy(技能选择准确率):判断每次调用的技能是否适配任务,对每个被调用技能返回二值结果;
- Skill Instruction Following(技能指令遵循度):评估智能体是否完整遵循被调用技能的指令,对每个规定步骤给出基于证据的五级评分;
- Skill Invoked(技能是否加载):在 Strands Evals 上提供的确定性检查,判断某个具名技能是否被成功加载,不调用模型。
三项评估器既可从 Strands Evals 的录制轨迹上运行,也能通过 AgentCore CLI 从 OpenTelemetry 追踪中评估,从而覆盖不同观测栈。
评估结果指向不同修复路径
两类失败的修复方向并不相同。AWS 在博客中给出 HR 助手的示例:员工询问牙科与视力福利,若智能体调用了福利技能但工具调用本身指向 PTO 规划剧本,Skill Selection Accuracy 可隔离出选型错误;如果智能体正确进入 PTO 规划技能,却跳过「按最新 HR 政策核对结转规则」这一步,Skill Instruction Following 能定位到缺失环节。
- 不当选择通常意味着技能描述存在重叠或歧义,需要重新组织目录;
- 指令遵循不完整则提示步骤描述需要更清晰、技能结构需要重排,或底层智能体模型需要更强推理能力。
通过把评估粒度下沉到单次技能调用与单条指令步骤,AWS 把 agent 评估从「整体响应是否合理」推进到「路由是否正确、流程是否走完」,为生产环境中的智能体调试提供了更精细的抓手。
