工具
KerasHub 集成 vLLM,可原生用于模型推理服务
KerasHub 新增 vLLM 集成,支持以原生方式调用 vLLM 部署模型,获得显著推理性能提升。
2026.08.08 · 周六约 2 分钟阅读
KerasHub 近日宣布与高性能推理引擎 vLLM 完成集成,开发者现在可以原生使用 vLLM 来部署 KerasHub 模型,享受显著的推理性能提升。该消息由 Keras 作者 François Chollet 在社交平台公开发布。
集成要点
- 生态打通:KerasHub 模型可直接通过 vLLM 进行服务化部署,无需额外的模型格式转换或胶水代码。
- 性能收益:据发布方描述,相比默认推理路径,vLLM 路径可带来「large performance gains」,但具体倍数、吞吐量或延迟数据尚未在公告中给出。
- 用户门槛:对于已在使用 KerasHub 构建和训练模型的团队而言,切换到 vLLM 服务化方案的迁移成本被进一步降低。
背景与意义
KerasHub 是 Keras 团队推出的面向自然语言处理与多模态模型的库,覆盖预训练模型加载、微调与部署等流程。vLLM 则是当前主流的开源大模型推理引擎,以 PagedAttention 等机制著称,在高并发场景下吞吐表现突出。两者此前分属不同生态,集成意味着 Keras 用户也能享受到 vLLM 在显存管理与批处理调度上的优化。
尚未披露的信息
截至目前,官方公告中暂未公布以下细节:
- 支持的具体模型范围与版本
- 性能对比的基准条件(输入长度、并发数、硬件配置)
- 集成是否已合并至 KerasHub 主分支,或以独立插件形式提供
开发者关注点
对于正在评估或已使用 KerasHub 进行模型训练、但寻求更高效在线推理方案的团队,建议关注后续官方仓库的更新日志与示例代码,以确认兼容性及性能收益是否符合预期。
