桃子桃子快讯
返回首页
开源

Accio 开源 CommerceAgentBench,107 项任务评测电商智能体

Accio 发布开源基准 CommerceAgentBench,覆盖采购、上架、履约等 107 项任务,13 个模型家族…

2026.08.29 · 周六2 分钟阅读

阿里巴巴旗下的 AI 采购助手 Accio 宣布开源 CommerceAgentBench,这是一套专门用于评测电商场景下 AI 智能体表现的基准测试。基准共包含 107 项任务,覆盖采购、上下架、运营、订单履约与售后五大核心环节,是目前少有的面向完整电商链路的多任务 agent 评测体系。

评测机制:以「痕迹」代替「答卷」

与传统以选择题或文本比对为主的基准不同,CommerceAgentBench 采用「结果痕迹打分」的方式:智能体在模拟电商后台执行操作,系统根据其留下的状态变化来评定表现,例如是否正确打上商品标签、是否生成了草稿、是否成功发布 listing、是否返回了运单 ID 等。这种评测方式更贴近真实业务中 agent 接管后台系统的协作流程,强调端到端的执行能力,而非单步的文本准确率。

覆盖规模与初步结果

官方在本次发布中报告了一次跨模型对比实验:

  • 任务总数:107 项,覆盖五大电商环节。
  • 评测框架:共使用 3 种 agent harness。
  • 模型范围:横跨 13 个不同的模型家族。
  • 当前天花板:得分上限为 61.7%。

61.7% 的整体上限说明,即使在表现最好的模型与框架组合下,电商 agent 在完整链路任务中仍有较大提升空间,采购、履约与售后等长尾环节是当前主要瓶颈。

行业意义与待补充信息

CommerceAgentBench 的开源填补了 agent 评测中「电商垂直场景」的空白,可作为厂商自测模型在 To B 业务自动化能力时的参考工具。但本次披露仍缺少具体的模型名称清单、各任务分项得分以及与现有通用 agent 基准(如 SWE-bench、GAIA 等)的对比数据,相关细节有待论文或技术报告进一步公开。对于关注 agent 产品化的团队而言,这是一份值得跟踪的基准。

信源