桃子桃子快讯
返回首页
研究论文

研究:推理结构并非越复杂越好,存在 token 预算拐点

在 FinQA 等任务上实验发现,token 预算低于约 1,000 时规划开销反致性能为零,超过约 1,500 后带验…

2026.08.31 · 周一3 分钟阅读

arXiv 上发表的一篇题为《Thinking Costs Tokens: When More Structure is Worth the Price》的论文,聚焦一个常被忽视的问题:在语言模型推理过程中引入「规划—校验—修正」结构虽能提升能力,但其本身也消耗 token,那么在什么样的预算下,这种开销才是「划算」的?作者在金融问答任务上做了系统的对照实验,给出了一个相对清晰的拐点。

研究动机

推理型智能体通常会在单次生成之外,额外调用模型做规划、答案自检与失败后的修复。这些步骤会消耗本该用于作答的 token 预算,但在小预算场景下,过早引入复杂结构反而可能挤占回答空间,导致正确率归零。因此,作者希望找到那个「结构化推理真正跑赢单次调用」的 token 临界点。

实验设计

研究选用 GPT-5.4 mini 作为统一底层模型,在 FinQA 与 TAT-QA 两个金融推理基准上展开评测:

  • 任务与数据:FinQA、TAT-QA,共 1,000 个测试样本。
  • 预算档位:14 档,从 250 到 42,000 个 output-equivalent token。
  • 对照系统:
    • Monolith:单次 LLM 调用,无显式规划与校验。
    • Verified Search:额外引入规划、标签盲校验(label-blind checking)与失败后修复能力。
  • 样本量:两套系统 × 1,000 案例 × 14 档 = 共 28,000 个完成单元。

为保证结论稳健,作者还使用了严格的 intersection-union 检验,p 值阈值设为 ≤ 0.001。

关键发现

实验结果呈现明显的「预算分层」特征:

  • 极低预算(250、500 token):两套系统得分均为 0%,原因是连完整的提示词都放不下。
  • 1,000 token 档:Monolith 达到约 18%,而 Verified Search 接近 0%——规划开销已经吃掉了所有作答空间。
  • 1,500 token 及更高:Verified Search 持续反超 Monolith,并在高预算区保持稳定优势。
  • 最高档位(约 42,000 token):Verified Search 约 44%,Monolith 约 40%。

经 intersection-union 检验,拐点落在 1,000 到 1,500 token 之间,且两端均满足 p ≤ 0.001 的显著性条件。

结论与启示

该研究给出一条对工程实践较为直接的指导:在为推理/Agent 链路设计 token 预算时,需要先判断预算是否足以同时容纳「结构开销」与「最终答案」。在本文设定的任务与模型下,这个安全阈值大约在 1,500 token 附近;低于约 1,000 token 时,复杂的验证式结构不仅无益,反而会显著拖低表现。同时,论文也提示,不同任务与模型组合的拐点位置可能不同,作者采用的「多预算档位扫描」方法本身可作为评估推理结构性价比的通用框架。

信源