Agent 路由拐点已至:前沿模型只需介入约 7% 轮次
2026 年 8 月中旬三项独立发布共同证实,Agent 执行中仅约 7% 轮次需前沿模型,其余可交由 30B 级模型,…
2026 年 8 月中旬的一周内,三项独立发布同时给出量化证据:在多步骤 Agent 执行流中,仅约 7% 的轮次真正需要前沿大模型介入,其余 93% 可由 30B 级中等模型完成,整体成本可下降 70% 以上。这标志着 Agent 工程范式正在从「选定一个强模型逐轮付费」转向「轮次级路由、按需调度」。
LangChain × NVIDIA Switchyard:7% 这一数字
LangChain 在自家 Deep Agents 评测套件上对 NVIDIA 的 Switchyard 路由库做了基准测试,覆盖 145 个多步骤任务。核心结果如下:
- 仅 7% 的轮次调用了 Claude Opus 4.8;
- 剩余 93% 交由 30B 模型完成;
- 综合效果:成本下降约 74%,准确率折损约 6 个百分点。
7% 的关键意义在于:它指向的是单个 Agent 执行循环内部的模型切换,而非跨 Agent 的路由推荐。被判定需要前沿模型的,是规划拐点、工具返回值的歧义解读、失败恢复这几类高难度瞬间;其余的论证构造、结果校验、子 Agent 分派、格式化输出,全部由更廉价的权重承担。
执行层模型就位:Nemotron 3.5 Lightning 与 Muse Glimmer
要让「轮次级路由」成为默认选项,两个条件必须同时成立:一是 30B 级开源模型在工具调用上不再静默失败,二是路由决策本身廉价可靠。
NVIDIA 发布 Nemotron 3.5 Lightning,正面卡位这一需求:
- 30B MoE 架构,激活参数仅 3B;
- 官方定位明确为「长时 Agent 的高吞吐执行层」——工具调用、结果校验、子 Agent 委派;
- 不与前沿模型对标竞争,而是作为承接 93% 流量的基础设施。
Meta 同周发布的 Muse Glimmer 同样为 30B 参数,4-bit 量化后显存占用低于 20GB,可在本地完成多步工具调用与失败恢复。两者构成 30B 段位「执行层可用」的直接证据,也改变了廉价路径的部署拓扑:本地运行不再有显著能力牺牲。
Unify 实践:两周砍掉 95% 成本
Connor Heggie 记录的 Unify 案例是上述分布的生产侧注脚:两周内将 Agent 成本削减 95%,且未出现质量回退。他明确点出的几个杠杆——提示缓存命中率优化、OpenAI 缓存 15 RPS 上限、子 Agent 作为函数调用、键控记忆——本质都是在「让廉价路径更廉价、让昂贵路径更罕见」。
值得注意的一条工程约束:LLM 评判模型必须与被评模型属于不同家族。这不仅是评估规则,也意味着评判器本身是路由图中的一个节点,其经济学遵循同一分布。
Agent 架构出现双循环
上述趋势带来的直接后果是:Agent 设计从单一循环变为两个嵌套循环——上层是 Agent 自身的语义循环(规划、执行、观察、修正),下层是路由循环,逐轮将每一步分配到合适的模型档位。把模型选择视为部署期常量的做法正在被淘汰。
几条值得明确的推论:
- 提示缓存必须按档位绑定:Unify 的缓存优化前提是同一档位持续命中相同前缀,轮次级切模型会直接破坏缓存局部性;
- 评测必须分档进行:若 Opus 仅处理 7% 轮次,端到端评测会同时掩盖两端的回归,LangSmith Engine 等工具的故障聚类将主要落在廉价档位;
- 「不同家族」约束复合放大:当执行器是 30B 模型、规划器是 Opus、评判器必须再换家族时,路由端点至少三个,各自成本曲线需独立核算;
- 单模型基准不再描述系统:即便是 Gemini 3.7 Flash 的 AutomationBench、AnalystAgent 等成绩,也只刻画单模型配置,路由系统的数字将与此截然不同。
六个百分点折损并非自动赢家
74% 的成本下降对应约 6 个百分点的准确率损失,是否划算完全取决于任务对错误的容忍度。在面向最终用户的生产链路中,6 个百分点的回退可能意味着可观测的体验劣化;而在内部批处理、子任务委派等容错场景下,这笔账显然划算。
业界正在浮现的实践启发是:按「前沿模型只应看到少数轮次」来规划路由表。如果实际比例显著偏高,要么任务确实端到端困难(罕见),要么路由器调参不足。
