LLMPanel:一键部署 vLLM / Ollama 的开源推理控制台
LLMPanel 是 MIT 开源的 LLM 部署平台,无需 Kubernetes,可一键把 Hugging Face…
LLMPanel 是一个面向自托管大模型推理场景的开源部署平台,采用 MIT 协议,目前已在 GitHub 上发布。其核心卖点是「不写 YAML、不用 Kubernetes」,用户在一台装好 Docker 的 Linux 机器上执行一条安装命令,即可拉起 API、控制台与网关,并打印登录地址。
多云统一编排
平台把本地 Docker 主机与多家 GPU 云(RunPod、Vast.ai、Lambda Cloud、Hyperstack)整合到同一个机队视图里。用户只需粘贴对应厂商的 API Key,云端 GPU 便会连同实时利用率、显存、温度、功耗一起出现在面板中。当本地算力吃紧时,可以直接在同一工作流中把负载 burst 到云上,无需切换工具链。
模型与推理引擎
LLMPanel 内置 Hugging Face 模型目录,支持 vLLM 和 Ollama 两种推理后端。部署流程被简化为「选模型 → 选 GPU → 点部署」三步:容器、权重、端点由平台自动处理。以 Llama 3.3 70B 为例,FP8 权重约需 70 GB 显存,单卡 H100 80GB 可满足短上下文场景;若要 32K 上下文,目录预设会切换到 2× H100 张量并行。
OpenAI 兼容网关
所有部署统一挂载在一个 OpenAI 兼容的 base URL 之后,开发者可以直接复用 OpenAI SDK 指向该网关。网关层负责路由,并为每个应用或环境签发独立 API Key,支持 rpm、tpm、日上限、过期时间与一键吊销。模型后端发生切换时,上层应用无需改动任何代码。
可观测与运维
- GPU 监控:每张卡的利用率、显存、温度、功耗实时推送到面板,无需额外 exporter;CPU、RAM 也一并暴露。
- 请求日志:包含状态码、延迟、prompt/completion token 拆分、调用来源 Key,可按模型、Key、时间筛选并内联查看完整 payload。
- 成本与可用性:每个部署展示每小时成本与运行时长,便于资源核算。
Agent 与 RAG
平台附带 Agent 模块,用户可上传文件,系统自动完成切片与 embedding,内置聊天窗口用于回归测试,之后再通过 Telegram、Discord 或 Webhook 接入外部渠道。系统提示词与知识库均按部署粒度绑定。
适用与局限
对于不想自己维护 Kubernetes、Terraform 或多套监控仪表盘的中小团队,LLMPanel 提供了一条相对省力的路径;但它定位仍是单机到小型机队的轻量控制台,并不替代生产级的 MLOps 平台。自托管完全免费,云托管方案另行计费。
