FlowEvo:用工作流与技能的协同进化打造自演化智能体
研究者提出无需训练的 FlowEvo 框架,将成功轨迹编译为可复用技能,在 ALFWorld 上取得 82.8% 成功率…
大型语言模型驱动的智能体在解决复杂任务时,往往通过推理、工具调用与代码执行组合构建推理时工作流。然而,这些工作流中涌现出的有用程序常常是「一次性」的:它们帮助解决了当前任务,却无法以系统化的形式沉淀下来,为后续任务提供帮助。针对这一问题,来自东南大学等机构的研究者在 arXiv 上发表了 FlowEvo 框架,试图让智能体在无需更新模型参数的前提下,通过工作流与技能的协同进化,持续积累并优化任务求解能力。
核心思路:训练无关的技能沉淀机制
FlowEvo 的关键设计在于将「成功的执行轨迹」转化为「可复用的技能记录」。每条记录包含一个可调用产物(如一段可执行代码)以及配套的结构化指引,并在入库前尽可能经过接口、复现与安全性三类校验。这些技能记录被持久化保存在推理时的技能库中,供后续任务直接调用或作为上下文注入。
具体而言,FlowEvo 由三个相互耦合的机制组成:
- 工作流到技能的编译:从成功轨迹中抽取可复用的可执行产物,形成结构化技能记录。
- 技能到工作流的反馈:在后续任务求解时检索已积累的技能,支持直接执行或以结构化上下文注入的方式复用。
- 技能策展:监控技能的下游效用,抑制那些会带来负迁移的技能记录。
三者共同构成一个「工作流 → 技能 → 工作流」的闭环反馈循环,使智能体在推理阶段就能不断打磨能力,无需重新训练模型。
实验结果:准确率与成本的双重优势
研究者在三类基准上对 FlowEvo 进行了评估,覆盖交互式环境与代码/数学生成任务:
- ALFWorld(交互式环境):FlowEvo 取得 82.8% 的成功率,较评估中最强基线高出 23.6 个百分点。
- HumanEval(代码生成):作为评测基准之一纳入对比。
- GSM8K(数学推理):同样用于验证框架泛化能力。
在效率层面,FlowEvo 的单回合平均 token 用量低于所有对比基线中最高效者的 一半,实现了更优的「准确率—成本」权衡。此外,受控消融实验证实,上述三个机制各自都对最终结果有所贡献,移除任意一项都会带来明显性能下降。
开源与适用场景
FlowEvo 是一个「训练无关」的框架,部署时不需要更新底层模型参数,因此对算力与训练数据的要求较低,适合在已有大模型之上快速搭建具备经验沉淀能力的智能体系统。研究团队已将代码开放在 GitHub 仓库 DEFENSE-SEU/FlowEvo,便于研究者复现与扩展。
从适用场景看,FlowEvo 尤其契合那些需要反复调用相似工具或执行相似步骤的任务——例如多步骤代码生成、交互式环境中的长程决策,以及带有固定工具链的客服/运维流程。其核心思想——把临时性成功经验固化为可复用资产——也为后续 agent 系统的工程化设计提供了一种值得借鉴的范式。
