桃子桃子快讯
返回首页
研究论文

SMITH:联合训练工具创建与使用的RL框架

台大与Appier联合提出SMITH框架,将工具创建与调用放入同一策略的强化学习闭环,4B Qwen3在多项任务上刷新最…

2026.08.26 · 周三3 分钟阅读

由台湾大学与Appier AI Research联合提出的SMITH(Schema-grounded Multi-task Iterative Tool Honing)框架,针对大语言模型智能体在工具缺失场景下的能力瓶颈,将「写工具」与「用工具」放在同一个策略的强化学习闭环中联合优化,使生成工具的模型能够从工具是否被成功调用中直接获得梯度反馈。该工作在13个程序推理任务上使用精确校验器训练4B规模的Qwen3,在未见任务上达到79.9%的宏平均准确率,刷新所有对比方法的最优成绩,并显著超越未训练的30B-A3B工具生成模型。

核心动机:写与用脱节导致的能力天花板

当前工具增强型LLM的能力受限于人类已编写的API。当所需工具不存在时,传统做法(如LATM、CRAFT、TroVE、KTCE等)会用一个强大的冻结LLM在推理时合成新工具,再交给另一个更弱的模型调用。写工具的模型从不获知自己写出的接口是否真的便于调用,因此schema模糊、调用失败等问题没有梯度回传,成为一个开放的训练缺口。SMITH把这两端合并为同一策略的闭环:在闭环中,同一模型先写工具(Python函数+JSON schema),之后仅凭schema调用工具;调用是否成功直接作为奖励反哺给写工具的策略。

为支撑这一闭环,论文重点解决两个训练难题:

  • 奖励分解:工具失败可能源于代码错误、schema错误、两者不一致或设计不当,每种失败模式需要不同的修正信号。
  • 循环评估:评估工具需要一个评判者,但模型评判自身活权重不可靠,冻结的外部评判者又无法随策略共同进化。

方法:基于DAPO的多任务强化学习

SMITH采用DAPO(GRPO的clip-higher变体)作为优化器,每个batch混合两类rollout:

  • Build任务:策略看到4个问答样例,从中归纳通用过程,并输出OpenAI兼容的(Python函数, JSON schema)对。该工具随后在16道更高难度的保留问题上运行验证,全部由模型自生成,无真值答案对照。
  • Use任务:策略收到目标问题与工具池条目(1个匹配领域工具+2个跨领域干扰工具),需在最多5轮内识别正确schema并完成调用,并施加效率惩罚。

两类任务优化的是同一组权重,因此工具创建与消费的梯度在每一步都会同时更新同一参数。

关键实验结果

在13个程序推理任务的未见测试集上,4B Qwen3经SMITH训练后取得79.9%的宏平均准确率,为所有对比方法中最高,并超过未经训练的30B-A3B工具生成模型。在域外任务上:

  • TabMWP-Hard:40.4
  • GQA:42.6,较同骨干推理时最强基线提升+7.6,且未使用任何视觉或表格训练数据
  • 输出token数较标准CoT减少约32倍

进一步将SMITH训练的4B模型所产出的工具提供给一个冻结的350M学生调用,其成绩与使用数量级更大模型写出的工具相当。同时,这一训练配方在无需改动的情况下,同样提升了Qwen3-8B与Granite-3.3-8B的表现,显示方法的通用性。

信源