OpenRouter 升级 Auto router:用社区花费驱动模型路由
OpenRouter 上线新版 Auto router,基于每周 55T token 的实际花费分布自动选模型,在五个基…
OpenRouter 近日对其 Auto router 进行了重大更新,改用平台上每周约 55T token 的真实花费数据来驱动模型选择。官方表示,「由市场花费决定的模型选择,在广泛的任务类型和成本区间上都优于旧版 Auto router」。新版路由默认对所有用户启用,开发者只需在请求中传入 model: openrouter/auto 即可使用。
基准测试:多场景优于旧版
官方使用五个差异化的基准来评估新旧路由的表现,覆盖知识、智能体、搜索、研究与编码五大类任务:
- MMLU Pro(知识):新版默认 85.2%,旧版默认 86.6%;新版 Max 91.4%,旧版 Max 88.8%。
- τ³-bench Banking(智能体):新版默认 20.6%,旧版默认 21.0%;新版 Max 31.6%,旧版 Max 7.2%。
- WideSearch(搜索):新版默认 61.6%,旧版默认 53.1%;新版 Max 61.9%,旧版 Max 54.8%。
- DSQA(研究):新版默认 62.9%,旧版默认 43.2%;新版 Max 63.0%,旧版 Max 42.3%。
- SWE-Atlas QnA(编码):新版默认 30.4%,旧版默认 30.4%;新版 Max 60.7%,旧版 Max 仅 2.4%。
新版默认档为 cost_tier=low,Max 档为 cost_tier=max。在编码场景的 Max 档上,新版相对旧版提升超过 58 个百分点,是这次更新中最具说服力的结果之一。
成本对比:默认档普遍更便宜
官方同时给出各基准对应的美元开销,新版在默认档普遍更低:
- MMLU Pro:默认 $140.93(旧 $393.34);Max $255.71(旧 $449.61)。
- τ³-bench Banking:默认 $155.89(旧 $320.04);Max $168.41(旧 $99.36)。
- WideSearch:默认 $30.75(旧 $31.83);Max $36.89(旧 $31.60)。
- DSQA:默认 $276.00(旧 $147.11);Max $248.83(旧 $144.18)。
- SWE-Atlas QnA:默认 $297.23(旧 $463.73);Max $1,325.08(旧 $205.52)。
需要注意的是,多模型切换会因缓存重建产生额外开销,因此新版引入了「粘性」策略:只要当前模型仍是该任务的优选,就尽量在多轮对话中保持不变,避免频繁切换。
新版路由的工作方式
新版 Auto router 的核心思路是把用户群体的实际花费当作实时信号,原理可分为四步:
- 任务分类:一个轻量级分类器把每条 prompt 分到约 30 个细粒度任务类型,如代码调试、多步智能体规划、知识问答、数学、客服、研究报告等。
- 按真实花费份额排序:针对该任务类型,路由查找过去 7 天内 OpenRouter 社区实际花费集中在哪些模型上,类似官方排行榜的「花费份额」视图。当用户把某个工作负载迁移到新模型时,路由会在数天内跟随调整。
- 应用成本档位:
cost_tier参数提供 low、medium、high、xhigh、max 五档,决定愿意支付的价格区间,从而筛选对应价位的候选模型池。 - 带回退的路由:最终选出主选模型与若干回退模型,按花费份额排序。路由同时遵守用户在账户中设置的模型与提供商限制。
整个流程基于聚合且脱敏的花费统计完成,prompt 在飞行中被分类,不做持久化存储,官方强调不会影响用户的隐私与数据策略。
意义与局限
这是 AI 推理中间层的一种新尝试:用「群体选择」替代「专家调参」来决定模型组合。优势在于跟随社区真实偏好的速度很快,且成本曲线天然贴近市场均衡;局限在于它对 OpenRouter 自身流量规模高度依赖,且新模型若尚未被广泛使用,进入路由池会有滞后。对于在 OpenRouter 上同时使用多家模型的开发者来说,这意味着默认就能获得接近前沿表现同时成本更低的推理路径,而不再需要为每类任务手动挑选模型。
