研究论文
推理模型 API 显式指定高推理强度:成本上去了,准确率未必跟上来
一项预注册研究发现,显式要求 Sonnet 5 以高推理强度调用,每次成本多花约 1 美分,但准确率差异未能确认。
2026.08.19 · 周三约 3 分钟阅读
来自 arXiv 的一篇预注册研究对「在 API 调用中显式指定高推理强度(reasoning effort)」这一做法提出了冷静的实证观察:在「Sonnet 5」上,显式高强度相比省略推理强度参数,每次调用平均多花约 0.01031 美元,但准确率差异在统计上未能确认。换言之,多付的钱未必买到可测量的能力提升。
研究设计:预注册、配对对照、单一任务
研究者采用「注册式配对对照」(registered paired contrast)方法,将同一模型在两种合同下进行对比:
- 合同一:显式声明高推理强度
- 合同二:省略推理强度参数
任务集为 AIME 2026 的 30 道题目,每题调用 5 次。每次付费调用被分配到一个冻结的终末类别,对推理过程中的样本重新抽样的同时保留重复调用。请求登记表、解析器、终末分类法、统计方案与分析流水线均在结果出炉前冻结,结论因此被严格限定在该模型、该任务与该采集日期内。
主要结果:成本差距显著,能力差距未能检测
- 每次调用平均成本差:+0.01031 美元,95% 置信区间 [+$0.00204, +$0.01974],合同一更贵。
- 准确率差:+0.0133,置信区间 [−0.0267, +0.0467],未检测到显著差异。
- 区间上限提示:设计无法排除高强度合同带来最高 4.67 个百分点的潜在增益。
- 预注册点估计下,每答对一道题的成本:高强度合同 0.08665 美元 vs 省略合同 0.07662 美元。
「省略」语义是模型特定的
研究者还做了一次「日期化合同普查」,结合 Models-API 元数据与预注册的原始响应探针,发现不同模型(甚至同一厂商内部)对于「省略推理强度参数」的处理方式并不一致:有的模型默认低强度,有的直接回落基础模式。这使得「不写 effort 参数」在不同 API 上并非等价操作。
局限与适用边界
作者明确将结论限定在:
- 单一模型(文中所示为 Sonnet 5)
- 单一任务集(AIME 2026,30 题)
- 单一采集时间窗口
若原始响应结构无法解析,相关声称为「文档级」而非「实证级」。对于希望管理推理预算的 API 采购方而言,这项研究提示了一个常被忽视的工程事实:推理强度参数的设置应被视为模型特定的合同条款,而非通用开关;在未经验证前,付费购买高强度未必等价于获得更高正确率。
