桃子桃子快讯
返回首页
研究论文

MAPD:把专有模型推理能力蒸馏进开源搜索智能体

一篇 arXiv 论文提出多智能体协议蒸馏框架,用结构化 JSON 协议作为中间表示,在七个 QA 基准上稳定优于现有蒸…

2026.07.29 · 周三3 分钟阅读

在智能体搜索(Agentic Search)任务中,大模型需要交替进行多步推理与外部检索以完成知识密集型问题。然而,传统基于结果奖励的强化学习只能提供稀疏监督,知识蒸馏虽有潜力,但专有模型通常隐藏 logits 且 tokenizer 不兼容 logits 匹配,原始轨迹模仿又容易只学到表层风格而非核心推理能力。针对这一"异构蒸馏"难题,arXiv 新论文提出了一种名为 MAPD(Multi-Agent Protocol Distillation)的联合蒸馏与强化学习框架。

方法核心:用结构化协议做中间表示

MAPD 的关键设计是引入一种"风格归一化的结构化协议"作为教师模型与学生模型之间的中间表示。训练流程分两步:

  • 离线多智能体系统(MAS)分解每个查询,检索支持证据,修复失败的搜索,并将完整探索轨迹转写为 JSON 协议,包含任务类型、推理计划和抽取式锚定事实。
  • 训练时,协议仅对学生策略中一个特权分支可见,其 token 分布为稀疏的 RL 目标提供稠密的蒸馏信号。

这一设计的优势在于:既绕开了专有模型隐藏 logits 的限制,又避免了直接模仿自然语言轨迹带来的风格漂移和冗长退化问题。

实验结果:跨教师模型均稳定提升

作者在七个 QA 基准上对 MAPD 进行了系统评估,并将其与多种蒸馏和 RL 基线方法对比。核心数据如下:

  • 以 Qwen3-1.7B 作为学生模型,平均成功率约 39.4%。
  • 以 Qwen3-4B 作为学生模型,平均成功率约 44.4%。
  • 在多个基准上整体优于现有蒸馏与 RL 方案。

论文还报告了一个关键特性:框架对不同类型的专有教师模型具有较强的泛化能力,并能有效抑制学生策略的风格漂移和冗长化倾向。

意义与局限

MAPD 的价值在于,为"如何在不暴露 logits、tokenizer 又不兼容的情况下,把专有强模型的推理能力迁移到开源小模型"这一长期痛点,提供了一条可操作的路径。对正在构建搜索增强型智能体或本地化 RAG 系统的开发者而言,这种协议化的蒸馏思路具有参考意义。

不过论文也存在一些待观察之处:实验所用专有教师的具体身份未在摘要中披露,学生模型仅覆盖 Qwen3-1.7B 和 Qwen3-4B 两个规模,更大模型或不同架构下的表现尚待验证;arxiv 编号 2607.24280 为预印本,尚未经过同行评审。感兴趣的读者可前往 arXiv 查阅完整论文与代码细节。

信源