桃子桃子快讯
返回首页
研究论文

AgentAbstain 评估框架:测出 LLM 智能体何时该主动放弃行动

新研究提出首个智能体主动放弃行动评估框架 AgentAbstain,实测 17 款前沿大模型,最佳准确率仅 59.5%。

2026.07.20 · 周一2 分钟阅读

一项新研究提出首个针对大语言模型智能体「主动放弃行动」能力的系统化评估框架 AgentAbstain,并对 17 款前沿模型进行了实测。结果显示,即使表现最佳的智能体在配对任务上的准确率也只有 59.5%,且研究团队指出,「放弃」能力与「完成任务」能力之间高度独立,仅靠扩大任务求解能力并不能弥合这一差距。

研究动机:智能体不仅要会「做」,还要会「不做」

基于大模型的智能体正被越来越多地部署到自动化任务中,但现有评估普遍只关注任务成功率,而非智能体能否识别「不该行动」的时机。这一缺口带来真实的风险:在指令含糊、约束冲突或工具调用失败时,智能体可能执行不可逆的错误操作。AgentAbstain 正是为了系统衡量智能体在工具调用场景下的「校准式放弃」能力。

框架设计:配对任务与自动化生成管线

AgentAbstain 的核心是一个面向智能体的「放弃」场景分类体系,覆盖执行前推理与运行时发现两大阶段,共 8 类场景。基准包含 263 个配对任务,运行在 42 个可执行沙盒环境中,每个任务由一个「应当执行」的版本和一个通过受控扰动(指令、工具或环境状态)构造的「应当放弃」版本组成。

为应对数据污染并支持规模化扩展,研究者设计了 AbstainGen 全自动管线,端到端合成沙盒环境并生成配对任务,并辅以确定性回放与基于 LLM 的语义判官验证。三位独立标注者对抽样任务的评定中,94–98% 被判定为「设计良好」。需要时还可按需重新生成全新任务实例。

实测结果:最佳仅 59.5%,且与任务能力无关

研究团队在 4 种智能体框架下测试了 17 款前沿大模型:

  • 表现最佳者为 Gemini 3.1 Pro,配对准确率为 59.5%;
  • 研究进一步指出,「放弃」能力与通用任务求解能力几乎独立,意味着仅靠扩大模型规模或提升解题能力难以自动带来更好的「拒做」判断;
  • 团队识别出多种失效模式,例如「事后放弃」——智能体先执行了不可逆操作,之后才识别到本应放弃的触发条件。

意义与开源

AgentAbstain 将智能体安全评估的重心从「能否完成」延伸到「何时该停下」,为构建更可靠的自主系统提供了新的度量工具。论文代码与数据集均已开源,论文全文 56 页、含 13 张图表,可在 arXiv 上获取(编号 2607.10059)。

信源