桃子桃子快讯
返回首页
工具

开源 AI 网关 Miser 发布:用分类路由降低 LLM 成本

Miser 是基于 Rust 的开源 AI 网关,可将请求按分类路由到 OpenRouter 上更便宜且能力合适的模型,…

2026.08.14 · 周五5 分钟阅读

Miser 是一款基于 Rust 编写的开源 AI 网关,面向 OpenAI 兼容客户端(包括 OpenCode、Codex、Aider、各类 SDK),把请求自动路由到 OpenRouter 上「最便宜且能力足够」的模型,从而在不显式切换模型的前提下压低 LLM 调用成本。它以无状态代理方式运行,保留未知字段原样转发,支持流式响应,并通过 x-miser-* 响应头回传本次路由的元信息,方便调用方排查与审计。

整体架构

Miser 在客户端与上游模型之间提供透明代理。请求抵达网关后会按优先级依次经过:

  • override:显式指定模型或层级的最高优先级规则
  • structural:基于请求结构的分类
  • heuristics:基于正则与特征的轻量分类

每一层都可以选择把判断交给一个可选的本地 LLM(如 Ollama)或云端 LLM,进一步提升复杂请求的分层准确率。整个网关不存储会话状态,所有原始字段透传给上游。

分类器模式

config/miser.toml 中通过 classifier.mode 选择:

  • heuristic:纯本地零成本分类,基于结构与正则
  • local_llm:调用与 OpenAI 兼容的本地或 Ollama 端点
  • cloud_llm:调用与 OpenAI 兼容的云端分类模型
  • hybrid:默认模式,先用启发式,仅在置信度不足时触发模型兜底,模型调用设有独立超时

hybrid 模式设计偏保守:启发式结果只有在置信度足够高时才被直接接受,模糊请求才进入模型判断,以降低误路由概率。

评测结果

Miser 自带两套离线评测:分类准确率(evals/cases.jsonl)与完成质量(evals/quality_cases.jsonl),并在公开 VPS 上给出了带时间戳的实测数据。

分类基准

2026-08-09 的 VPS 实测显示,在 25 条覆盖 trivial、simple、standard、hard、reasoning、override、tool-use、structured-output 的样本上:

  • Rust 启发式:精确分层准确率 92.0%,p50 与 p95 延迟均小于 1 ms
  • 云端 GPT-4.1-mini:精确 60.0%,相邻层 84.0%,p95 延迟 20.69 s
  • OpenRouter Auto:精确 52.0%,相邻层 84.0%,欠路由率 32.0%
  • 本地 Qwen 1.7B(2 vCPU CPU-only Ollama):精确 4.0%,失败 19 例
  • hybrid 级联:精确 64.0%,相邻层 72.0%,失败 7 例

作者明确指出这是分类基准,而非生成质量基准。

完成质量与软件工程基准

在 10 条样本的完成质量跑分中,Miser Auto 平均质量 0.967、通过率 100%;OpenRouter Auto 为 0.90、70%;GPT-4.1-mini 为 0.86、70%。代价是延迟与输出 token 更高,作者强调语料规模小、评分为自动 rubric,结果属于方向性而非结论性。

在 100 条真实软件工程任务、以 GLM 5.2 作为独立 LLM 评判的对比中:

  • Miser Auto:质量 0.637、通过率 64%、分类准确率 64%
  • OpenRouter Auto:质量 0.477、通过率 48%、分类准确率 0%
  • GPT-4.1-mini:质量 0.785、通过率 80%、分类准确率 0%
  • GLM 5.2:质量 0.312、通过率 32%
  • Claude Sonnet 4:质量 0.732、通过率 72%

Miser 是其中唯一具备分类路由能力的方案,相对 OpenRouter Auto 质量提升 33.4%、通过率提升 16 个百分点;不过 GPT-4.1-mini 与 Claude Sonnet 4 在该基准上的绝对质量与通过率仍高于 Miser。

运行与后续路线

本地启动只需复制 config/miser.env.example、设置 OPENROUTER_API_KEY,再运行 cargo run -p miser-gateway -- --config config/miser.toml,随后在 OpenCode 等客户端中将 baseURL 指向 http://127.0.0.1:8787/v1 即可。

作者列出的下一步包括:执行式代码检查、配对式模型评判、模型质量历史、按路由归一化的成本计算、并发限制,以及在质量低于阈值时自动升一级。其总体目标是让生产路由器在成本与延迟预算之内优化质量,而非单纯追求最高质量。

信源