开源
Accio 开源 CommerceAgentBench,107 项任务评测电商智能体
Accio 发布开源基准 CommerceAgentBench,覆盖采购、上架、履约等 107 项任务,13 个模型家族…
2026.08.29 · 周六约 2 分钟阅读
阿里巴巴旗下的 AI 采购助手 Accio 宣布开源 CommerceAgentBench,这是一套专门用于评测电商场景下 AI 智能体表现的基准测试。基准共包含 107 项任务,覆盖采购、上下架、运营、订单履约与售后五大核心环节,是目前少有的面向完整电商链路的多任务 agent 评测体系。
评测机制:以「痕迹」代替「答卷」
与传统以选择题或文本比对为主的基准不同,CommerceAgentBench 采用「结果痕迹打分」的方式:智能体在模拟电商后台执行操作,系统根据其留下的状态变化来评定表现,例如是否正确打上商品标签、是否生成了草稿、是否成功发布 listing、是否返回了运单 ID 等。这种评测方式更贴近真实业务中 agent 接管后台系统的协作流程,强调端到端的执行能力,而非单步的文本准确率。
覆盖规模与初步结果
官方在本次发布中报告了一次跨模型对比实验:
- 任务总数:107 项,覆盖五大电商环节。
- 评测框架:共使用 3 种 agent harness。
- 模型范围:横跨 13 个不同的模型家族。
- 当前天花板:得分上限为 61.7%。
61.7% 的整体上限说明,即使在表现最好的模型与框架组合下,电商 agent 在完整链路任务中仍有较大提升空间,采购、履约与售后等长尾环节是当前主要瓶颈。
行业意义与待补充信息
CommerceAgentBench 的开源填补了 agent 评测中「电商垂直场景」的空白,可作为厂商自测模型在 To B 业务自动化能力时的参考工具。但本次披露仍缺少具体的模型名称清单、各任务分项得分以及与现有通用 agent 基准(如 SWE-bench、GAIA 等)的对比数据,相关细节有待论文或技术报告进一步公开。对于关注 agent 产品化的团队而言,这是一份值得跟踪的基准。
