Cursor Router 升级:自动匹配最优模型,成本最高降 68%
Cursor 更新 AI 模型自动路由系统,Auto Intelligence 以低于 Fable 68% 成本达到更高…
Cursor 推出的大模型自动路由系统 Cursor Router 自 7 月 22 日上线以来持续迭代,最近一次更新带来显著的性价比提升。其中 Auto Intelligence 模式在比 Fable 低 68% 成本的情况下达到高于 Fable 的用户满意度,相比初始版本又下降了 18%;Auto Balance 模式在比 Opus 4.8 低 41% 成本的条件下实现体验反超,并较此前进一步降本 8%,用户满意度再提升 3%。
路由逻辑:复杂度先行,模型匹配随后
Cursor Router 的核心思路是:不依赖 benchmark 分数估算模型强弱,而是从真实开发者使用数据中学习每个模型在不同类型任务上的真实表现。
每轮对话的路由决策都基于当前回合与近期对话状态信号,包括任务类别、近期工具调用,以及更宏观的工作上下文。决策分两步:
- 第一步判断当前回合是否足够简单、可以交给价格高效的模型处理,由 Cursor 自研的复杂度预测器 Compass 完成。
- 第二步当回合更复杂时,再依据任务类别从多个前沿模型中选出最可能表现优秀的那一个。
Compass:用真实反馈预测复杂度
Compass 通过预测用户是否会对 Cursor 的回复满意来评估任务复杂度,训练数据来自用户的后续行为:用户继续推进下一个任务是强正向信号,纠正智能体行为则是强负向信号。
在线评估显示,Compass 评分具备良好的预测能力:
- 评分最高的回合获得正向性能信号的比例达 96%。
- 评分最低的回合获得正向性能信号的比例为 71%。
实际运行时,Compass 会为每个回合输出一个介于 0 到 1 之间的连续复杂度分数,系统在该范围内设置阈值来决定哪些回合保留在低价模型上、哪些升级到前沿模型。阈值越低,更多流量留在低价模型;阈值越高,更多回合被升级。
模型画像:每个模型各有所长
Cursor 基于真实开发者流量构建了一套分类体系,从三个维度刻画每一回合的工作:
- 领域(Domains):后台、数据库 schema、前端等。
- 任务(Tasks):修 bug、执行命令、写测试等。
- 修饰符(Modifiers):限定范围的编辑、产品向问题、强视觉改动等。
通过这套分类评估不同模型的表现后,Cursor 发现没有任何模型能在所有任务上全面领先,各有擅长领域:
- Grok:在广泛的日常工作中具备高性价比,推理成本低,特别适合 Git 命令和通用数据库操作等场景。
- Sol:在规划与代码库理解上表现突出,在多类实施任务上也能以更低成本取得强结果。
- Opus:在执行密集型工作上表现良好,在 DevOps、数据库查询和性能优化方面有优势。
- Fable:在调试与视觉类实现上有优势,对于复杂任务,其质量提升足以抵消更高成本。
组合策略与门槛
Compass 与分类体系互为补充。Compass 给出与模型无关的复杂度分数并与路由阈值比较——低于阈值则直接交给 Grok 以利用其低推理成本;高于阈值则进入分类路由流程,依据在该类任务上观察到的最强表现选择前沿模型。
候选模型只有在被观察到对该类任务的性能相对低价模型具备单侧 75% 的提升幅度时才会被启用,即系统需要约 75% 的把握确认这一性能优势是真实存在的。这一保守策略可避免因样本噪声导致的频繁误升级。
整体来看,Cursor 把「自动选模型」做成了一个可观测、可调控的系统组件,让开发者在不同任务上隐性获得多模型组合的优势,而无需手动切换 API 或模型配置。
