Open-ultra:自训练式 LLM 路由代理,按真实工作择优分配流量
一款为编程代理设计的开源 LLM 路由代理,通过影子流量在廉价模型上验证能力,自训练路由器,逐步把能匹配前沿模型的请求迁…
Open-ultra 是一款面向 Claude Code、Codex、OpenCode 等编程代理 CLI 的开源 LLM 路由代理,由 numinous-technology 在 GitHub 开源。其目标是在不损失输出质量的前提下,把可由廉价开源模型胜任的请求迁移到廉价模型,只为真正需要前沿能力的请求支付高价。
工作机制:影子通道 + 自训练路由器
代理位于编程代理与上游模型之间,对请求做字节级转发,不增加延迟。主干道上请求原样发往前沿模型,认证头一并透传,使用者行为不变。
与此同时,一条始终开启的影子通道在后台用廉价模型重放同一请求。影子模型存在两种运行模式:
- response-only 模式:相同请求字节直接打到影子模型;
- worktree-exec 模式:影子模型在一个临时 git worktree 中跑代理循环,工具被限制在该 worktree 内,最终以 diff 形式产出。
影子模型的结果会被一个可配置的 judge 模型与前沿模型的真实产出对比打分,按答案对答案或 diff 对 diff 的粒度记录到 pairs.jsonl,用于后续训练。当某个廉价模型在某类任务上持续达到或超过前沿模型的得分后,路由器才会把这类流量切换过去;在那之前,代理就是一个透明的 passthrough,默默积累证据。
路由器是一个共享分类器,每个池内模型挂一个独立的 capability head;阈值以上的模型被视为合格,代理在合格模型里挑选当前在线且最便宜的一个,否则回退到前沿模型。价格与可用性来自 pool.json 配置,而非模型权重。
接入方式与兼容性
代理对外同时支持 Anthropic Messages 与 OpenAI Chat Completions / Responses 协议入站;出站仅采用 OpenAI 兼容协议,覆盖 OpenRouter、vLLM、Ollama、SGLang、Together、DeepSeek 等几乎所有主流推理服务。影子模型、grader 与前沿模型在 pool.json 里只是三个不同的端点条目。
针对 Claude Code、Codex、OpenCode 三种 CLI,官方在 Day 1 即提供封装命令 openultra claude / codex / opencode,并已通过实测验证包含流式与被路由请求的完整会话。除此之外,openultra attach claude 可把 ANTHROPIC_BASE_URL 写入 ~/.claude/settings.json,实现持久接管;任何支持 base_url 覆盖的 SDK 也可直接指向 http://localhost:8484 使用。
安装与使用
通过 PyPI 上的 uv tool 安装:
uv tool install open-ultra- 或
uv tool install "git+https://github.com/numinous-technology/open-ultra" - 也可克隆后
uv tool install --editable .做开发模式安装
首次使用依次执行:
openultra init:写入 API key、选择 pool 预设(free / budget / balanced 三档)、连通性检查;openultra claude:自动拉起守护进程,把 Claude Code 接到代理上;openultra report:查看每个模型在各类任务上的 as-good 比例与预估节省;openultra train:基于累积的 pairs 拟合路由器;openultra route on:启用按模型分流,路由到不达标的请求自动回退到前沿模型。
预设中的 balanced 档位默认包含 Flash 与 MiniMax M3 等廉价模型;free 档接入限速的零成本模型用于试用。
设计上的取舍
代理刻意回避了几类常见做法:不依赖通用 benchmark 或合成数据,而是用使用者真实工作流训练路由器;路由在路由器通过评估前保持关闭,廉价模型必须真的在当前工作上达到前沿水平才获得流量;分流失败时透明回退,不让单次降级扩散成系统性问题;每个训练版本可命名、可热切换,必要时可即时回滚到旧路由器。
