桃子桃子快讯
返回首页
行业动态

路由模型集成正取代单一前沿模型,成「深度研究」最强形态

OpenRouter、Sakana AI 与洛斯阿拉莫斯国家实验室相继验证:路由组合的多模型集成在 DRACO 基准上超…

2026.07.22 · 周三3 分钟阅读

自今年 5 月以来,OpenRouter、Sakana AI 与美国洛斯阿拉莫斯国家实验室先后公布了一项共同的发现:在「深度研究」类任务上,多个 AI 模型经路由组合后的准确率,可以超过任何单一前沿模型。OpenRouter 的案例显示,集成方案在 DRACO 基准上以相当于 Anthropic Fable API 一半的价格,取得了同等级别的输出质量。该结果随后被 OpenMined 的两位研究者在一个月后独立复现,仍然成立。

多方独立验证同一结论

OpenRouter、Sakana AI 与洛斯阿拉莫斯国家实验室分属不同机构,使用不同模型池与不同路由策略,却得出方向一致的结果:把若干模型的回答按一定规则组合,整体得分高于其中任何一个模型单体。OpenMined 的复现进一步降低了单一来源的偶然性,使这一现象更接近可被严肃讨论的「趋势」而非个别实验。

原因:模型错误呈「反相关」

这一现象并非全新概念,而是机器学习中集成学习的旧思路在生成式 AI 时代被重新发现。当 10 个模型面对同一提示词作答时,它们的错误往往以「反相关」的方式分布——也就是说,A 模型犯的错与 B 模型犯的错倾向于不重叠。因此,当 2 到 3 个模型在某一答案上达成一致时,这一答案正确的概率通常高于任何单一模型独立作答的正确率。在 DRACO 这类需要对大量事实进行检索、整合、推理的「深度研究」基准上,这种「多数共识」机制被显著放大。

权力重心从前沿实验室转向路由平台

即便最终答案中包含前沿模型,提问者面对的「入口」也不再是单一模型提供商的 API,而是 Sakana、OpenRouter 这类路由平台。从三个维度看,这种变化都意味着权力结构的迁移:

  • 用户关系:过去「最准确的深度研究 AI」由前沿模型厂商直接交付,如今由路由平台充当用户与模型之间的中介与「门面」。
  • 经济定价:单一模型涨价并不会直接传导至终端用户,路由方可以吸收价格变化或在用户无感的情况下替换模型,定价权随之转移到路由方。
  • 政治开关:当 Fable 之类的模型被关闭时,路由平台仍能调度其他模型达到同等级别的质量,「关掉一个模型就等于关掉深度研究」的局面被打破。

价格不升反降

OpenRouter 与洛斯阿拉莫斯的研究均指出一个反直觉的结果:集成方案在提升准确率的同时,通过引入更小、更便宜的模型参与投票,把「达到前沿水平」的总成本压到了更低。OpenRouter 的实验显示,同等质量下的推理成本可降至 Fable 单独使用时的约 50%。这意味着在「质量 / 成本」的帕累托前沿上,当前胜出的并不是任何单一模型,而是路由集成方案——至少在「深度研究」这一场景下如此。

后续观察

该文作者所在的 OpenMined 表示,将在更多基准上继续验证集成方案是否稳定优于单模型。若结论延续,前沿模型厂商在「深度研究」这一类产品中的相对优势将进一步被路由层稀释,整个 AI 服务的价值链与定价逻辑也可能随之重塑。

信源