AI 智能体长任务为何容易中途失效
研究以恒定失败率解释智能体长任务衰减,拆分流程可降低单次连续执行风险。
AI 智能体即使每个步骤看起来较为可靠,在多步骤任务中仍可能快速失效。相关分析援引 Toby Ord 的 arXiv 论文指出:按人类完成同类任务所需的时间衡量,智能体在执行期间面临近似恒定的失败率,成功概率会随任务时长呈指数衰减。
单步可靠不代表全流程可靠
若智能体每一步的成功率为 95%,独立执行 10 步后,整体成功率仅为 0.95¹⁰,约为 60%。这意味着即使各环节没有明显退化,整条工作流也可能因步骤不断累积而失败。失败通常在流程中途才暴露,并可能留下已完成与未完成操作混杂的状态。
Ord 将每分钟发生失败的比率记为 λ,并用 N(t)= N₀·e^(−λt)描述成功概率随时间的衰减。任务达到半数失败所需的时间为 t½ = ln(2)/ λ。核心问题因此不是任务突然变难,而是每次执行都在增加系统暴露于失败风险的时间。
48 步工作流会放大微小失误
以每月为 8 家客户生成报告为例,每位客户需要依次完成 6 个步骤,整个任务共 48 步。在步骤独立且每步成功率固定的假设下,端到端结果为:
- 单步成功率 99% 时,完整任务成功率约 62%;
- 单步成功率 95% 时,完整任务成功率仅约 8.5%;
- 单步成功率 90% 时,完整任务成功率约 0.6%。
因此,一个单步表现堪称优秀的智能体,按 95% 可靠性连续处理 48 步,平均约每 12 次任务才有 1 次完整成功。失败还可能发生在前几位客户已经收到报告之后,使剩余业务状态难以直接判断。
模型进步仍难消除执行暴露
METR 通过比较人类专家与智能体完成同一任务所需的时间,衡量任务时长达到多长时成功率降至 50%。其数据显示,这一时间跨度过去 6 年大约每 7 个月翻倍,近期增长还有加快迹象。
不过,50% 成功率仍相当于抛硬币,无法直接代表日常业务流程所需的稳定交付水平。文章援引 Gartner 2025 年 6 月的预测称,到 2027 年底,超过 40% 的智能体 AI 项目可能因成本上升、商业价值不明确和风险控制不足而被取消。
缩短运行并保留检查点
更现实的工程方案是把 48 步流程拆成 8 个彼此隔离的 6 步任务。在 95% 单步成功率下,单个客户任务的成功率约为 73.5%。即使全部 8 个客户任务连续完成的总概率没有改变,失败也能被定位到具体客户,并可单独重试,而不必重新执行整条链路。
这种方法只有在检查点可靠保存时才会生效。模板、已获取数据和中间结果需要持久化,后续任务不能重新推导或抓取已经完成的内容。对当前系统而言,减少单次无人值守的运行长度、建立可恢复检查点并隔离重试范围,通常比单纯等待模型能力提升更具可操作性。
