Cursor Router 升级:按任务自动匹配最优模型
Cursor 更新 Auto Intelligence 与 Auto Balance 两种路由模式,分别以更低成本达到或…
Cursor 于 7 月 22 日上线 Cursor Router 的两种自动路由模式 Auto Intelligence 与 Auto Balance,并在近期完成了又一次迭代。官方披露的数据显示,Auto Intelligence 在用户满意度上已达到 Fable 同等水平,成本降低 68%;Auto Balance 在满意度上超越 Opus 4.8,成本降低 41%。自发布以来,两种模式又分别进一步下降了 18% 和 8% 的成本。
数据驱动的路由思路
Cursor Router 的核心假设是:模型选择应基于真实开发者任务上的表现,而非 benchmark 分数。每个轮次(turn)的路由决策都依据当前轮信号与近期会话状态,包括结构化特征如任务类别,以及近期的工具调用和更广泛的上下文。
路由过程分为两步:首先判断当前任务是否简单到足以交给高性价比模型,这由 Cursor 自研的复杂度预测器 Compass 完成;如果任务较为复杂,则使用一个从真实流量中构建的任务分类体系,决定使用哪一款前沿模型。
Compass:判断任务是否「够复杂」
Compass 通过预测用户对回复的满意度来估计每个轮次的复杂度,训练数据来自用户后续动作这一性能信号——顺利进入下一个任务是正面信号,主动纠正则视为负面信号。
在线评估显示,Compass 打分最高的轮次中,96% 获得了正面信号;打分最低的轮次中仍有 71%。实际部署时,Compass 给每个轮次输出 0–1 之间的连续复杂度分数,再与设定阈值比较:阈值以下保留在高性价比模型,阈值以上则升级到前沿模型。
从真实流量中学习模型能力
当 Compass 判断需要前沿模型时,Cursor 用一个三维分类体系进一步路由:
- 领域(Domains):描述工作发生在哪里,如后端、数据库 schema、前端等
- 任务(Tasks):描述开发者想完成的事,如修复 bug、运行命令、编写测试
- 修饰符(Modifiers):跨领域、跨任务的特征,会影响模型选择,如限定范围的编辑、产品问题、视觉密集型变更
基于这一体系,Cursor 发现没有单一模型在所有任务上占优,每个模型都有各自擅长的领域:
- Grok:在广泛的日常任务中性价比突出,低推理成本使其在 Git 命令、通用数据库操作等场景尤其有效
- Sol:在规划与代码库理解上表现优秀,多项实现任务也能以更低成本取得强结果
- Opus:在执行密集型任务上表现强劲,DevOps、数据库查询、性能优化等场景尤为突出
- Fable:在调试与视觉实现上优势明显,复杂任务上的高质量产出值得其更高成本
路由算法如何组合
Compass 和分类体系各司其职:Compass 输出模型无关的复杂度分数,与路由阈值对比后,决定直接交给 Grok(凭借低推理成本)还是进入分类路由阶段。进入分类路由后,模型选择遵循两条规则:
- 仅在性能明显更优时切换:候选模型必须在其对应任务标签上的表现,相对高性价比模型达到 75% 的单侧提升阈值,才会被纳入候选
- 结合任务特性选择:依据分类体系给出的领域、任务和修饰符,挑选在历史数据中表现最强的模型
Cursor 表示,路由系统会随模型前沿的演进而持续迭代,目标是在新模型出现时自动把它们的能力纳入调度。
