开源 AI 网关 Miser 发布:用分类路由降低 LLM 成本
Miser 是基于 Rust 的开源 AI 网关,可将请求按分类路由到 OpenRouter 上更便宜且能力合适的模型,…
Miser 是一款基于 Rust 编写的开源 AI 网关,面向 OpenAI 兼容客户端(包括 OpenCode、Codex、Aider、各类 SDK),把请求自动路由到 OpenRouter 上「最便宜且能力足够」的模型,从而在不显式切换模型的前提下压低 LLM 调用成本。它以无状态代理方式运行,保留未知字段原样转发,支持流式响应,并通过 x-miser-* 响应头回传本次路由的元信息,方便调用方排查与审计。
整体架构
Miser 在客户端与上游模型之间提供透明代理。请求抵达网关后会按优先级依次经过:
- override:显式指定模型或层级的最高优先级规则
- structural:基于请求结构的分类
- heuristics:基于正则与特征的轻量分类
每一层都可以选择把判断交给一个可选的本地 LLM(如 Ollama)或云端 LLM,进一步提升复杂请求的分层准确率。整个网关不存储会话状态,所有原始字段透传给上游。
分类器模式
在 config/miser.toml 中通过 classifier.mode 选择:
- heuristic:纯本地零成本分类,基于结构与正则
- local_llm:调用与 OpenAI 兼容的本地或 Ollama 端点
- cloud_llm:调用与 OpenAI 兼容的云端分类模型
- hybrid:默认模式,先用启发式,仅在置信度不足时触发模型兜底,模型调用设有独立超时
hybrid 模式设计偏保守:启发式结果只有在置信度足够高时才被直接接受,模糊请求才进入模型判断,以降低误路由概率。
评测结果
Miser 自带两套离线评测:分类准确率(evals/cases.jsonl)与完成质量(evals/quality_cases.jsonl),并在公开 VPS 上给出了带时间戳的实测数据。
分类基准
2026-08-09 的 VPS 实测显示,在 25 条覆盖 trivial、simple、standard、hard、reasoning、override、tool-use、structured-output 的样本上:
- Rust 启发式:精确分层准确率 92.0%,p50 与 p95 延迟均小于 1 ms
- 云端 GPT-4.1-mini:精确 60.0%,相邻层 84.0%,p95 延迟 20.69 s
- OpenRouter Auto:精确 52.0%,相邻层 84.0%,欠路由率 32.0%
- 本地 Qwen 1.7B(2 vCPU CPU-only Ollama):精确 4.0%,失败 19 例
- hybrid 级联:精确 64.0%,相邻层 72.0%,失败 7 例
作者明确指出这是分类基准,而非生成质量基准。
完成质量与软件工程基准
在 10 条样本的完成质量跑分中,Miser Auto 平均质量 0.967、通过率 100%;OpenRouter Auto 为 0.90、70%;GPT-4.1-mini 为 0.86、70%。代价是延迟与输出 token 更高,作者强调语料规模小、评分为自动 rubric,结果属于方向性而非结论性。
在 100 条真实软件工程任务、以 GLM 5.2 作为独立 LLM 评判的对比中:
- Miser Auto:质量 0.637、通过率 64%、分类准确率 64%
- OpenRouter Auto:质量 0.477、通过率 48%、分类准确率 0%
- GPT-4.1-mini:质量 0.785、通过率 80%、分类准确率 0%
- GLM 5.2:质量 0.312、通过率 32%
- Claude Sonnet 4:质量 0.732、通过率 72%
Miser 是其中唯一具备分类路由能力的方案,相对 OpenRouter Auto 质量提升 33.4%、通过率提升 16 个百分点;不过 GPT-4.1-mini 与 Claude Sonnet 4 在该基准上的绝对质量与通过率仍高于 Miser。
运行与后续路线
本地启动只需复制 config/miser.env.example、设置 OPENROUTER_API_KEY,再运行 cargo run -p miser-gateway -- --config config/miser.toml,随后在 OpenCode 等客户端中将 baseURL 指向 http://127.0.0.1:8787/v1 即可。
作者列出的下一步包括:执行式代码检查、配对式模型评判、模型质量历史、按路由归一化的成本计算、并发限制,以及在质量低于阈值时自动升一级。其总体目标是让生产路由器在成本与延迟预算之内优化质量,而非单纯追求最高质量。
