桃子桃子快讯
返回首页
工具

开源 LLM 路由器 LLMrPro 发布:本地推理与云端兜底统一接口

LLMrPro 是开源自托管 LLM 路由器,以单一 OpenAI 兼容 API 调用本地机器推理,云端按层级兜底。

2026.07.21 · 周二5 分钟阅读

LLMrPro 是一款开源、自托管的大模型请求路由器。它对外只暴露一个兼容 OpenAI Chat Completions 格式的 API 端点,把请求优先派发给用户自己机器上运行的本地推理引擎(如 LM Studio、Ollama、vLLM、llama.cpp 以及 macOS 上的 MLX);当本地算力不足时,再按预设层级透明回落到 OpenAI、Anthropic、Google 或 Azure OpenAI 等云端服务。整个流程对调用方透明,无需修改任何客户端代码。

核心设计:三层级 + 自动回落

LLMrPro 将请求划分为三个层级:frontier、mini、nano,每个层级对应一个云端兜底后端。客户端只需向对应层级的端点发送标准 Chat Completions 请求,携带 Bearer 密钥即可。

  • 本地优先:路由器从已配对的桌面代理池中挑选可用节点派发推理任务,节点通过 WebSocket 出站连接,无需开放入站端口或修改防火墙。
  • 自动回落:当本地代理池无法服务某层级请求时,自动调用该层级配置的云端提供商,支持可配置的重试与退避策略。
  • 单租户自托管:一个组织部署一个 balancer 实例,密钥、数据、基础设施完全由用户掌控,只有显式配置的云端回落才会离开本地环境。

路由器在响应头中通过 X-Balancer-* 系列字段标明本次请求由谁服务、为何回落,便于排查与监控。

配套组件与运行机制

项目由两部分组成:

  • balancer:基于 Meteor 3.4 + MongoDB 6(需副本集以支持 change stream 响应式)的服务端路由与后台管理界面,含设备配对、代理吊销、层级配置、调度日志与健康状态等实时管理能力。
  • agent:基于 Electron + React 的桌面工作端,安装在每台参与推理的机器上,运行完整模型,通过签名令牌安全地与 balancer 通信。

部署上,本地开发只需 meteor npm install 即可在 :3500 启动;生产环境可通过 infra/azure/setup-vm.sh 一键在 Debian 12 上初始化 Node、MongoDB 副本集、nginx、systemd 与 ufw,再用 ./scripts/deploy.sh 完成构建、rsync 同步与原子软链切换部署。密钥采用 ${VAR} 占位符,通过 inject-secrets.sh 在启动时注入 settings.runtime.json,平台 Bearer 密钥仅以 SHA-256 哈希存储。

安全与管理

LLMrPro 内置多项安全机制:

  • 每来源速率限制;
  • 出站防护(SSRF 防护);
  • 提供商密钥静态加密;
  • 代理令牌签名 + 过期机制;
  • 硬化安装与部署路径。

后台管理 UI 基于实时 pub/sub,提供设备配对、代理撤销、层级配置、调度日志与健康检查等能力,便于运维实时掌控本地代理池状态。

与同类项目的差异

项目作者在 README 中列出了与现有方案的对比,意在突出其组合特性:

  • 与 exo、Petals 等分布式推理项目相比:后者在多设备间切分单个模型,LLMrPro 采用每节点运行完整模型的作业派发池,并叠加按层级云端回落与单租户自托管。
  • 与 LiteLLM、Bifrost 等 LLM 网关相比:后者路由与回落基于静态预配置端点,LLMrPro 引入一组可通过签名代理动态配对的本地桌面机器,无需静态配置。
  • 与 GPUStack、Kalavai 等 GPU 集群管理器相比:后者面向自有 GPU 集群调度,LLMrPro 进一步支持通过互联网接入的消费级桌面(含 macOS/MLX),并提供一键签名代理。
  • 与 Paddler、HiveCore 等自带 pull worker 的 balancer 相比:LLMrPro 增加了按层级云端回落与面向非技术用户的签名桌面应用。

仓库结构

仓库根目录布局清晰:

  • balancer/:Meteor 服务端 + MongoDB + React 后台 UI
  • agent/:Electron + React 桌面 worker
  • docs/:运维文档(部署、API、代理安装、故障排查)
  • infra/:Debian VM、反向代理、systemd 等配置脚本
  • DESIGN.md:完整架构、线协议与路由算法说明
  • SECURITY.md:安全模型与漏洞上报流程

LLMrPro 整体定位偏向追求数据本地化、希望统一管理多台个人设备算力、并保留云端弹性兜底的中小团队或重度个人用户。其 OpenAI 兼容接口让现有 SDK 与工具链几乎无需改造即可切换,是该项目降低接入门槛的关键设计。

信源