桃子桃子快讯
返回首页
工具

Meta 预览多模态智能体评测框架 WildArtifactBench

Meta AI 预告内部评估框架 WildArtifactBench,面向多模态智能体真实任务,先行释放 10 个任务。

2026.08.21 · 周五2 分钟阅读

Meta AI 在 X 平台预告了其内部评估框架 WildArtifactBench,旨在对智能体在复杂真实任务上的表现进行评测,重点覆盖多样化的交付物格式。本次披露内容较为简短,目前仅作为框架的初步预览。

框架定位与目标

WildArtifactBench 是 Meta AI 自研的评测框架,专门面向多模态智能体在现实场景中的复杂任务表现。与依赖严格真值评分标准(ground-truth rubrics)的传统评测方式不同,该框架希望扩展任务覆盖范围,使其能够更全面地覆盖实际多模态工作流中的多样化任务类型与交付物格式,从而更贴近真实使用场景来衡量智能体所带来的实际效用。

评估方法

该框架采用两项核心指标来评估智能体表现:

  • 胜率(win rates):基于两两对比,由评审者判断哪个交付物更优;
  • Elo 分数:源自偏好判断的累积评分体系。

评审者由人类与智能体(agentic preference judges)共同组成,偏好判断取代了严格的真值评分。这一设计使框架能够覆盖更广泛、更接近真实工作流的实际任务。

当前进展

作为评测推进的第一步,Meta AI 此次先行释放了 WildArtifactBench 中的 10 个任务样本,以展示其评测思路与任务设计方向。相关任务集合已通过 Meta AI 官方 X 帖子中的链接对外提供,更完整的框架细节尚未在本次预告中披露。

整体来看,WildArtifactBench 体现了 Meta AI 在多模态智能体评测方向上的新尝试,将「实际交付物的实用价值」作为衡量重点,而非局限于固定答案的得分匹配。随着后续任务数量的扩展与方法的完善,该框架有望为业界提供一种更贴近真实场景的智能体能力评价方式。

信源