开源
InferCrane:开源 AI 推理运营平台发布
Apache-2.0 协议的开源推理运营平台 InferCrane 发布,可在自有基础设施中为 AI 模型提供统一稳定的…
2026.08.28 · 周五约 3 分钟阅读
InferCrane 是一款以 Apache-2.0 协议开源的推理运营平台,定位介于「模型 API」与「自建推理集群」之间。它不替代 vLLM、SGLang 等推理引擎,也不绑定特定云厂商,而是把部署、观测、评估与发布决策统一在一层「控制平面」之后,让上层应用始终面对同一个稳定的模型别名与端点。InferCrane Cloud 目前处于私有预览阶段,开源版本可直接部署在用户自有的基础设施上。
核心设计:稳定端点与可替换执行层
InferCrane 把推理系统拆成两层:
- 模型身份层:应用始终通过类似
model="coder-production"的别名调用,OpenAI 兼容协议,无需感知底层变化。 - 执行层:实际由 vLLM、SGLang、LiteLLM 或外部 OpenAI 兼容 API 提供,运行时、GPU、网关、云厂商都可替换。
平台内部按「期望状态 → 实测状态」的循环运转:选择模型 artifact、确定运行时与精度(如 vLLM + L40S)、按需扩缩副本,最终发布为一个可持续重连的端点。当需要更换底层实现时,应用侧的模型身份保持不变。
三种接入方式
InferCrane 支持三种工作起点,方便团队按现状逐步迁移:
- 从模型部署新推理:选定模型与目标,平台自动规划并运行部署,得到一个稳定端点。
- 接入既有推理:以只观察模式挂载 vLLM、SGLang、LiteLLM 或其他 OpenAI 兼容端点,先观测再决定是否接管流量,避免强制迁移。
- 治理外部模型 API:把外部 Provider 的凭证保留在服务端,并施加隐私与支出上限,让外部 API 也能被统一管控。
测量驱动而非「拍脑袋」决策
在自托管是否值得这一问题上,InferCrane 不预设结论,而是要求给出可追溯的证据:
- 测量候选方案:记录 TTFT、TPOT、吞吐、错误率与可溯源的算力成本。
- 横向对比:在「模型 API」「自托管候选」「生产服务方案」之间形成可审计的发布决定与硬性预算。
- 证据标注:每条建议都会显式标记为「已测量」「建模估算」或「尚未测量」,避免虚标收益与价格。
与现有推理栈的协同
平台围绕成熟组件构建,而非重新造轮子:
- 推理引擎:vLLM、SGLang、自定义 runtime。
- 网关与代理:LiteLLM、OpenRouter、其他 OpenAI 兼容 API。
- 计算底座:AWS、Google Cloud、Kubernetes、RunPod 等。
- 观测与基准:OpenTelemetry、AIPerf。
运行时、网关、算力保持可替换,应用保持「一个模型身份」,是 InferCrane 强调的产品边界。
当前可用状态
截至项目发布,Apache-2.0 协议下的控制平面、CLI、网关、本地 quickstart、SDK 源码以及 Provider 集成均已公开;托管的 Web 控制台仍处于私有预览,需要申请加入候补名单才能获得 InferCrane Cloud 的发布更新与上线支持。
