桃子桃子快讯
返回首页
工具

AI 模型路由工具亮相:按上下文动态选模型

一款模型路由工具综合 KV 缓存、上下文等因素动态推荐模型与推理强度,每百万 token 路由费用 0.05 美元。

2026.08.05 · 周三1 分钟阅读

据 TestingCatalog 在 X 平台披露,一款面向大模型应用的智能路由工具正式进入测试阶段。该工具会在每次调用前综合评估多项上下文信号,据此推荐合适的模型与推理强度,并提供按量计费模式,定价为每百万 token 0.05 美元。

路由决策的核心维度

与传统按规则或随机分配请求的路由方案不同,该工具在选择模型时同时考虑以下因素:

  • KV 缓存状态:判断当前会话是否已具备可复用的缓存,以决定是否切换到更轻量的模型。
  • 子智能体结构:当调用涉及多智能体协作时,根据子代理拓扑调整路由策略。
  • 压缩事件:识别上下文压缩触发的次数与时机,避免在压缩后依然路由到高成本模型。
  • 完整会话历史:结合整段对话的累积信息,动态匹配最合适的推理强度。

性能与成本

作为每次路由的额外开销,该工具在调用链中会增加约 100–150 毫秒的延迟。这一代价换来的是在多模型混部场景下更精细的算力分配。按量计费模式下,路由本身的价格为每百万 token 0.05 美元,对多数应用而言属于可忽略的边际成本。

隐私保护模式

针对数据敏感场景,工具提供「隐私保护模式」。在该模式下,系统只对外发送派生元数据用于路由决策,原始请求 payload 始终保留在用户自有的技术栈内,不会离开本地环境。这一设计使其能够满足金融、医疗等对数据合规要求较高的行业落地需求。

信源