研究论文
多智能体数学推理研究:评审精确度高未必带来更好纠错
arXiv 论文指出,评审模型检测错误的精度与批评被采纳的程度可分离,广播式讨论在难题上反而胜过规划-执行-评审流水线。
2026.07.20 · 周一约 3 分钟阅读
arXiv 上一篇题为《Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning》的论文,对当前多智能体系统中常见的「分层评审」设计提出了实证质疑。研究者采用同一系列的 gpt-oss-120b 作为解题智能体,在 4,181 道经过验证器标注的 Omni-MATH 数学题上,对比了不同协作结构的表现,并围绕「评审环节是否真的把错误答案改对了」这一核心假设展开系统分析。
核心发现:评审精度与纠错效果可分离
论文设计的对比协议主要有两种:
- 规划-执行-评审流水线(PER):由规划器、执行器与专门评审器组成的层级结构,评审器在执行器之后单独给出反馈。
- 广播式同伴讨论(broadcast):所有智能体互相看到彼此的解,并通过讨论共同推进下一轮答案。
结果显示,在最容易的题目上,两种协议的差距很小;但从第 4 难度档(tier 4)开始,差距迅速拉开,广播式讨论的最终准确率高于 PER 流水线,这与「专人评审理应更优」的直觉相反。
精度高 ≠ 批评被采纳
研究者进一步剖析了这一差距的来源。
- PER 中评审器的错误检测精度为 0.861,明显高于广播式协议中的 0.644。
- 然而,评审给出的有用批评在 PER 中更难改变协议携带到下一步的候选答案,评审引导的修复(reviewer-guided repair)也更低。
这意味着:评审的「识别错误能力」与「批评被实际采纳」在经验上是可分离的,单看评审精度会高估整套系统的解题能力。
干预实验:强制确认未必有用
为验证上述结论,研究者在匹配的 PER 协议中做了两类干预:
- 强制要求解题智能体显式承认评审意见,结果最终准确率反而下降。
- 将评审反馈直接嵌入解题器的工作上下文,部分提升了评审意见的落实程度,但仍未弥合与广播式协议之间的差距。
对多智能体系统设计的启示
论文的核心启示是:以评审器为中心的评估指标可能误导系统选型。一个协议即便能精准发现错误,只要没有把批评落实下去,整体解题收益仍可能有限。这对当前常见的「加一层评审」的工程做法提供了具体的反面证据,也提示后续工作应同时衡量「识别能力」与「采纳率」两个维度,而不仅依赖单一精度指标。
