桃子桃子快讯
←返回首页
研究论文

Reddit 用户整理 Android 智能体评测文献库:梳理移动端 LLM 评估四大共性问题

一名研究者在 r/LocalLLaMA 分享论文清单,指出当前 Android 智能体评测普遍依赖模拟器、缺少部署指标、…

2026.09.26 · 周六约 2 分钟阅读

近日,Reddit 社区 r/LocalLLaMA 一名长期关注移动端智能体的研究者整理了一份专题论文清单,集中收录与 Android 智能体、LLM 移动端评测相关的研究工作。作者同时指出当前该领域评测体系存在的四项共性问题,引发社区讨论。

核心问题:真实设备评测仍是空白地带

作者首先质疑:「LLM 智能体真的能像一个普通用户那样完成一整天的工作吗?」为了回答这个问题,他系统梳理了近几个月发表的相关论文,发现移动端智能体评测长期面临与真实使用脱节的困境。

最突出的问题是,绝大多数现有基准测试运行在模拟器上,使得面向真实设备的指标难以获得。模拟器虽然便于批量复现实验,但与真机在系统调度、权限模型、UI 渲染等方面的差异,可能导致评测结果无法直接代表真实用户体验。

关键部署指标普遍缺失

  • 电池消耗:长时间任务下的功耗表现几乎未被量化。
  • 热管理:CPU/GPU 持续负载引发的温升与降频行为缺少观测。
  • 响应延迟:在真实硬件条件下的端到端时延缺乏系统记录。

这些指标对于判断一个智能体是否真正「可用」至关重要,但目前学术界对它们的关注度远低于准确率等任务级指标。

任务定义碎片化,缺乏全球化一致基准

另一个被反复提及的痛点是日常任务的分散现状。不同基准测试覆盖的语言、应用、操作类型各异,任务定义五花八门,没有形成一个跨地区、跨应用、可复用的统一任务集合。这意味着即便两个智能体在同一方向上各自表现优异,也很难横向比较其真实可靠性。

社区资源与作者倡议

为帮助更多研究者进入这一领域,作者将整理好的论文清单公开托管在 AlphaXiv 平台,链接指向一个共享文件夹,涵盖模拟器评测、真实设备测试、移动端多步任务等多个方向的核心文献。该清单本身并非新研究,而是为后续构建更严谨的评测方法提供索引基础。

整体来看,这份清单的价值不在于提出新模型或新基准,而在于为社区勾勒出一张清晰的「当前短板地图」:想要让 LLM 智能体真正走进日常手机使用场景,业界仍需要在真实设备、部署级指标、统一任务集三个方向补齐基础设施。

信源