桃子桃子快讯
返回首页
研究论文

GMA:面向真实复杂场景的通用移动智能体基准

arXiv 论文提出 GMA 移动智能体评测基准,含 7 款应用、300 项分层任务,对 8 款前沿模型进行系统评测与…

2026.08.31 · 周一2 分钟阅读

arXiv 近期上线了一篇关于移动智能体评测的论文,提出名为 GMA(General Mobile Assistants)的新基准,用于评估通用移动助手在真实复杂场景下的表现。该工作涵盖 7 款基于开源项目构建的应用与 300 项分层任务,并对 8 款前沿模型进行统一评测与 harness 消融研究。

研究背景:现有基准仍存覆盖缺口

图形用户界面(GUI)已成为评估多模态交互型 AI 智能体的重要环境。已有的 AndroidWorld、MobileWorld 等基准为移动智能体评测打下基础,但在应用覆盖范围与任务设计上仍难以充分反映真实移动使用的多样性与难度,亟需更具挑战性的测试平台。

GMA 基准设计

  • 应用覆盖:基于 7 款开源项目构建,覆盖生活方式分享、旅行规划等贴近日常的真实场景。
  • 任务规模:共 300 项任务,按 4 个难度梯度组织,从原子级动作逐步过渡到复杂的多步骤工作流。
  • 评测对象:在统一环境、统一模型设置与统一任务分类下,对 8 款前沿模型进行横向比较。

主要发现:复杂度仍是性能瓶颈

  • 随着任务复杂度上升,模型性能显著下降,当前主流智能体仍远未达到可靠处理真实用户需求的水平。
  • 消融研究显示,harness 设计(如上下文保留、显式状态跟踪)的恰当选择可明显提升表现,尤其在复杂工作流上效果最为突出。
  • 同一类 harness 设计在不同基础模型上的效果存在差异,不存在放之四海皆准的通用方案。

研究意义

GMA 通过扩展应用覆盖与任务复杂度,补充了现有基准的不足。它不仅为评估移动智能体提供了更具挑战性的测试床,也为研究 harness 设计如何支撑复杂移动工作流的可靠执行提供了可控实验环境,对智能体领域的工程实践与学术研究均有参考价值。

信源