桃子桃子快讯
返回首页
工具

InferCrane 发布 v1.0.0-rc.1:面向自托管推理的开源运维平台

开源推理运维平台 InferCrane 推出首个公开测试版,提供 OpenAI 兼容端点、证据门控发布与多后端支持。

2026.08.28 · 周五4 分钟阅读

InferCrane 近日发布了首个公开测试版 v1.0.0-rc.1,定位为面向自托管模型的开源推理运维平台。它在统一的 OpenAI 兼容端点之下,覆盖部署、运维、优化与安全演进全流程,帮助团队在不变更应用接口的前提下,更换底层模型制品、运行时、加速器、提供商、副本数与活跃版本。

安装与本地验证

用户可通过 Homebrew 安装 CLI,也可使用对应的 Python 或 Node.js SDK 预发布版:

  • brew install infercrane/tap/infercrane
  • python -m pip install 'infercrane==1.0.0rc1'
  • npm install '@infercrane/sdk@1.0.0-rc.1'

项目同时提供发布归档与 Terraform provider 二进制。无需 GPU 或云账号即可运行本地验证:git clone 仓库后执行 make demo,即可连接 OpenAI 兼容 worker、发送并检视请求、创建隔离候选、记录确定性的 Release Guard 拒绝、确认生产流量未发生迁移,并清理临时资源。

核心能力

InferCrane 将模型身份与底层实现解耦,应用始终面向同一个稳定端点。平台主要能力包括:

  • 部署或接管:操作 vLLM、SGLang、自定义 OCI 及兼容现有端点,覆盖 AWS、GCP、Kubernetes 与 RunPod。
  • 统一端点:在稳定的 OpenAI 兼容契约后路由多个版本与提供商。
  • 变更可证:在晋升前持久化请求、benchmark、质量、成本与灰度证据;当证据缺失时保留当前活跃版本。

与同类方案的差异

官方文档将 InferCrane 与几种常见方案做了边界划分:

  • vLLM + Kubernetes:提供推理引擎与编排清单,但缺乏证据门控的发布生命周期;InferCrane 补充确定性晋升、拒绝、回滚与变更记录。
  • LiteLLM:定位为路由层;InferCrane 额外承担部署生命周期、证据门控晋升与回滚,并可接入现有 LiteLLM 端点而不接管基础设施所有权。
  • 托管推理平台:适合希望由提供商运营基础设施的团队;InferCrane 则面向希望控制面、容量与计费边界留在自有基础设施中的团队。
  • 脚本与 CI:脚本可完成部署;InferCrane 标准化的是持久的拒绝/晋升/回滚决策及其附加证据。

从模型到端点的典型流程

平台提供可复现的「配方」作为配置起点,例如 infercrane workload init ./support --recipe qwen3-8b,随后执行 workload planworkload deploy --wait 即可完成部署。也可引入任意兼容的不可变模型标识,如 Mistral-7B-Instruct-v0.3。对于已运行中的工作负载,可先通过 infercrane connectdoctorobserve 三步建立观察,再逐步接管。

在优化环节,InferCrane 将建模提案与测量后的合格证据分离:optimize propose 基于模型、硬件、工作负载、SLO 与成本目标生成候选方案,再经 AIPerf、回放与质量评估后进入晋升或拒绝决策。vLLM、SGLang 与自定义 OCI 为当前执行路径,Dynamo 为实验性支持,TensorRT-LLM、LMCache、NIXL 等仍处于演进列表中。

信源