工具
Shepherd Model Gateway:面向 LLM 部署的开源路由网关
Shepherd Model Gateway(SMG)发布,用 Rust 编写,支持 vLLM、SGLang 等自托管后…
2026.07.27 · 周一约 3 分钟阅读
近日,Shepherd Model Gateway(SMG)在 Hacker News 亮相,这是一款面向大规模 LLM 部署的模型路由网关,主打「一次接入、多端调度」,目标是帮助企业在自托管推理引擎与多家云厂商之间统一出入口。SMG 由 Rust 编写,强调高性能与低延迟,号称可在亚毫秒级完成路由决策。
项目定位与核心能力
SMG 将自身定位为「引擎无关」的 LLM 网关,核心能力可归纳为以下几点:
- 缓存感知路由:理解 vLLM、TensorRT-LLM、TokenSpeed、SGLang 等推理引擎的 KV 缓存状态,优先复用前缀,降低重复计算。
- 统一 API 接入:通过单一端点即可路由到自托管模型或 OpenAI、Anthropic、Gemini、AWS Bedrock、Azure OpenAI 等云服务。
- 性能与稳定性:原生 gRPC 流水线、零拷贝分词、内置熔断与自动故障切换。
- 企业级控制:多租户速率限制(支持 OIDC)、WebAssembly 插件扩展、对话历史可保存在自有基础设施内。
- 可观测性:暴露 40+ Prometheus 指标、OpenTelemetry 链路追踪以及带请求关联的结构化 JSON 日志。
路由策略与协议覆盖
SMG 内置 8 种路由策略,覆盖常见的负载均衡与亲和性需求:
- cache_aware、round_robin、power_of_two、consistent_hashing、prefix_hash、manual、random、bucket。
在 API 协议层面,SMG 兼容 OpenAI Chat/Completions/Embeddings 接口、Responses API(面向 Agent)、Anthropic Messages,以及 MCP 工具调用,方便已有应用平滑迁移。
部署与高可用
项目提供了三种安装方式:
- Docker:
docker pull lightseekorg/smg:latest - Python:
pip install smg - Rust:
cargo install smg
启动时通过 smg launch 指定 worker 地址即可加入集群。对于多节点生产环境,SMG 基于 SWIM 协议提供 Mesh 组网能力,配合 --enable-mesh 与对等节点地址实现高可用。对话历史可插拔存储到 PostgreSQL、Oracle、Redis 或内存中,便于满足不同合规与性能要求。
适用场景与边界
对于自建 LLM 集群、又希望在同一入口对接多个云端模型的团队,SMG 提供了一种相对轻量的统一网关方案。但需注意,SMG 仍属早期阶段,相比同类项目(如 LiteLLM 等)尚未形成显著的差异化优势,适合愿意尝试 Rust 生态、关注低延迟路由与缓存复用的小规模到中等规模部署团队用于评估与试点。
