桃子桃子快讯
返回首页
工具

开发者推出 llmux:统一管理 vLLM 与 llama.cpp 的模型参数切换

一位开发者开源 llmux 工具,用 profile 机制统一管理 vLLM 与 llama.cpp 上的多模型参数切换…

2026.07.27 · 周一2 分钟阅读

一位开发者在 Reddit r/LocalLLaMA 板块分享了其开源项目 llmux——一个用于统一管理 vLLM 与 llama.cpp 上多模型推理参数的工具,项目以 MIT 协议开源。

工具定位与核心思路

作者表示,自己在日常测试中频繁在 vLLM 与 llama.cpp 之间切换模型,每次替换都要重新调整参数、启动和关闭服务,过程繁琐且容易出错。为此他开发了 llmux,将每一个模型抽象为一个 profile,写一次后即可从列表中选择启动;同一引擎的不同版本(如 release、nightly 或自编译镜像)也只需创建新的 profile 并绑定到不同的镜像 tag。

主要能力

llmux 提供两类使用方式:

  • Web 仪表盘:可视化选择 profile 并启动对应服务。
  • Headless CLI:llmux upps --jsonlogsbench 等子命令,支持脚本化调用和 SSH 远程操作。

环境要求与安装方式

  • 平台:Linux,需配备 NVIDIA GPU,并安装 NVIDIA Container Toolkit 以实现 GPU passthrough。
  • 暂不支持 macOS 与 AMD/ROCm。
  • 安装方式:可通过官方一键脚本安装,也可手动 git clone 后用 uv tool install 注册到 PATH。

项目信息

作者在帖子中说明该项目由其团队在实际工作中使用,英语非其母语,撰写帖子时借助了 LLM 辅助。

信源