工具
开发者推出 llmux:统一管理 vLLM 与 llama.cpp 的模型参数切换
一位开发者开源 llmux 工具,用 profile 机制统一管理 vLLM 与 llama.cpp 上的多模型参数切换…
2026.07.27 · 周一约 2 分钟阅读
一位开发者在 Reddit r/LocalLLaMA 板块分享了其开源项目 llmux——一个用于统一管理 vLLM 与 llama.cpp 上多模型推理参数的工具,项目以 MIT 协议开源。
工具定位与核心思路
作者表示,自己在日常测试中频繁在 vLLM 与 llama.cpp 之间切换模型,每次替换都要重新调整参数、启动和关闭服务,过程繁琐且容易出错。为此他开发了 llmux,将每一个模型抽象为一个 profile,写一次后即可从列表中选择启动;同一引擎的不同版本(如 release、nightly 或自编译镜像)也只需创建新的 profile 并绑定到不同的镜像 tag。
主要能力
llmux 提供两类使用方式:
- Web 仪表盘:可视化选择 profile 并启动对应服务。
- Headless CLI:
llmux up、ps --json、logs、bench等子命令,支持脚本化调用和 SSH 远程操作。
环境要求与安装方式
- 平台:Linux,需配备 NVIDIA GPU,并安装 NVIDIA Container Toolkit 以实现 GPU passthrough。
- 暂不支持 macOS 与 AMD/ROCm。
- 安装方式:可通过官方一键脚本安装,也可手动
git clone后用uv tool install注册到 PATH。
项目信息
作者在帖子中说明该项目由其团队在实际工作中使用,英语非其母语,撰写帖子时借助了 LLM 辅助。
