桃子桃子快讯
返回首页
工具

Open-ultra:自训练式 LLM 路由代理,按真实工作择优分配流量

一款为编程代理设计的开源 LLM 路由代理,通过影子流量在廉价模型上验证能力,自训练路由器,逐步把能匹配前沿模型的请求迁…

2026.07.21 · 周二5 分钟阅读

Open-ultra 是一款面向 Claude Code、Codex、OpenCode 等编程代理 CLI 的开源 LLM 路由代理,由 numinous-technology 在 GitHub 开源。其目标是在不损失输出质量的前提下,把可由廉价开源模型胜任的请求迁移到廉价模型,只为真正需要前沿能力的请求支付高价。

工作机制:影子通道 + 自训练路由器

代理位于编程代理与上游模型之间,对请求做字节级转发,不增加延迟。主干道上请求原样发往前沿模型,认证头一并透传,使用者行为不变。

与此同时,一条始终开启的影子通道在后台用廉价模型重放同一请求。影子模型存在两种运行模式:

  • response-only 模式:相同请求字节直接打到影子模型;
  • worktree-exec 模式:影子模型在一个临时 git worktree 中跑代理循环,工具被限制在该 worktree 内,最终以 diff 形式产出。

影子模型的结果会被一个可配置的 judge 模型与前沿模型的真实产出对比打分,按答案对答案或 diff 对 diff 的粒度记录到 pairs.jsonl,用于后续训练。当某个廉价模型在某类任务上持续达到或超过前沿模型的得分后,路由器才会把这类流量切换过去;在那之前,代理就是一个透明的 passthrough,默默积累证据。

路由器是一个共享分类器,每个池内模型挂一个独立的 capability head;阈值以上的模型被视为合格,代理在合格模型里挑选当前在线且最便宜的一个,否则回退到前沿模型。价格与可用性来自 pool.json 配置,而非模型权重。

接入方式与兼容性

代理对外同时支持 Anthropic Messages 与 OpenAI Chat Completions / Responses 协议入站;出站仅采用 OpenAI 兼容协议,覆盖 OpenRouter、vLLM、Ollama、SGLang、Together、DeepSeek 等几乎所有主流推理服务。影子模型、grader 与前沿模型在 pool.json 里只是三个不同的端点条目。

针对 Claude Code、Codex、OpenCode 三种 CLI,官方在 Day 1 即提供封装命令 openultra claude / codex / opencode,并已通过实测验证包含流式与被路由请求的完整会话。除此之外,openultra attach claude 可把 ANTHROPIC_BASE_URL 写入 ~/.claude/settings.json,实现持久接管;任何支持 base_url 覆盖的 SDK 也可直接指向 http://localhost:8484 使用。

安装与使用

通过 PyPI 上的 uv tool 安装:

  • uv tool install open-ultra
  • uv tool install "git+https://github.com/numinous-technology/open-ultra"
  • 也可克隆后 uv tool install --editable . 做开发模式安装

首次使用依次执行:

  • openultra init:写入 API key、选择 pool 预设(free / budget / balanced 三档)、连通性检查;
  • openultra claude:自动拉起守护进程,把 Claude Code 接到代理上;
  • openultra report:查看每个模型在各类任务上的 as-good 比例与预估节省;
  • openultra train:基于累积的 pairs 拟合路由器;
  • openultra route on:启用按模型分流,路由到不达标的请求自动回退到前沿模型。

预设中的 balanced 档位默认包含 Flash 与 MiniMax M3 等廉价模型;free 档接入限速的零成本模型用于试用。

设计上的取舍

代理刻意回避了几类常见做法:不依赖通用 benchmark 或合成数据,而是用使用者真实工作流训练路由器;路由在路由器通过评估前保持关闭,廉价模型必须真的在当前工作上达到前沿水平才获得流量;分流失败时透明回退,不让单次降级扩散成系统性问题;每个训练版本可命名、可热切换,必要时可即时回滚到旧路由器。

信源