工具
Hydra:本地优先的多模型 AI 路由 CLI,按置信度自动选最便宜模型
一款本地运行的 AI 路由工具,按置信度阈值把任务分发给最便宜的模型,并具备自动回退与可复现的统计指标。
2026.07.26 · 周日约 3 分钟阅读
Hydra 是一款面向开发者的多模型 AI 编排 CLI,定位为「本地优先的信任控制平面」。它会扫描本机上的 CLI Agent、API Key 与本地模型服务器,将每个任务分发给最便宜、且达到指定置信度的模型,并在不可用时逐级回退到本地模型。它把自己与 OpenRouter、LiteLLM、Portkey 等云端代理型网关区分开来,强调离线可用、零路由网络开销与本地账本。
核心机制
Hydra 的路由逻辑建立在三组数学曲线上:
- 成本-质量 Pareto 前沿:单一模型是曲线上的一个点,Hydra 在调度时按任务选择 Pareto 最优点,相同质量下选更便宜的头。
- 置信度最优停止:使用序贯概率比检验(SPRT),逐个询问候选模型,直到聚合置信度跨过目标阈值(例如 0.95)即停止。在阈值以下的任务会沿十级阶梯向下传递,最终落到本地 Qwen 兜底。
- 渗滤系数 κ:借鉴 Molloy–Reed 条件 κ = ⟨k²⟩/⟨k⟩ 度量代码依赖图中枢纽节点的「爆炸半径」,依赖越多、κ 越高的改动会被自动抬高置信度门槛。
关键数字与一句话总结
- 73%:常规任务通过路由改用中端或本地头后,相对「全用 Claude」的中位成本节省。
- 58%:从未离开本机的任务比例,作者称这一点是云端网关无法提供的。
- 0.95:默认目标置信度,对应 SPRT 停止阈。
- 12:在典型开发机上一次
hyctl probe能发现的「头」数量,涵盖 CLI Agent、API Key、Ollama、LM Studio 等。 - 100% 离线:路由决策阶段不发起任何网络请求,本地 Qwen 作为永不熔断的终端兜底。
这些数字均可通过 hyctl stats 与 hyctl probe 在本机复现,作者称不参与「tokens 处理量」式的竞争指标。
与现有网关的差异
在 Hydra 给出的能力矩阵中,云端代理(OpenRouter、LiteLLM、LiteLLM、Portkey)共有的能力是自动回退与成本日志;只有 Hydra 具备本地优先发现、置信度路由、本地账本与完全离线路由。少数能力(如 provider-neutral 路由)在 LiteLLM、Portkey 处于「部分支持」状态。
快速上手
安装与首次调度的官方路径被压缩为三步:
- 安装:单 Go 静态二进制,可通过 Homebrew(
brew install ankit373/hydra/hyctl)、npm(npm install -g hyctl)、pip(pip install hyctl)或一键脚本安装。 - 探测:运行
hyctl probe,自动列出本机所有可用的 AI 头。 - 调度:示例
hyctl dispatch --enum SIMPLE …,返回结果同时给出本轮所用层级与相对「全 Claude」基线节省的成本。
项目以 CLI 形式提供,主命令包括 hyctl dispatch --confidence、hyctl graph blast、hyctl mcp 等;交互式 Agent 树形驾驶舱被列为路线图项,其余矩阵中已勾选的能力均随 CLI 同步发布。
