桃子桃子快讯
返回首页
工具

KerasHub 集成 vLLM,可原生用于模型推理服务

KerasHub 新增 vLLM 集成,支持以原生方式调用 vLLM 部署模型,获得显著推理性能提升。

2026.08.08 · 周六2 分钟阅读

KerasHub 近日宣布与高性能推理引擎 vLLM 完成集成,开发者现在可以原生使用 vLLM 来部署 KerasHub 模型,享受显著的推理性能提升。该消息由 Keras 作者 François Chollet 在社交平台公开发布。

集成要点

  • 生态打通:KerasHub 模型可直接通过 vLLM 进行服务化部署,无需额外的模型格式转换或胶水代码。
  • 性能收益:据发布方描述,相比默认推理路径,vLLM 路径可带来「large performance gains」,但具体倍数、吞吐量或延迟数据尚未在公告中给出。
  • 用户门槛:对于已在使用 KerasHub 构建和训练模型的团队而言,切换到 vLLM 服务化方案的迁移成本被进一步降低。

背景与意义

KerasHub 是 Keras 团队推出的面向自然语言处理与多模态模型的库,覆盖预训练模型加载、微调与部署等流程。vLLM 则是当前主流的开源大模型推理引擎,以 PagedAttention 等机制著称,在高并发场景下吞吐表现突出。两者此前分属不同生态,集成意味着 Keras 用户也能享受到 vLLM 在显存管理与批处理调度上的优化。

尚未披露的信息

截至目前,官方公告中暂未公布以下细节:

  • 支持的具体模型范围与版本
  • 性能对比的基准条件(输入长度、并发数、硬件配置)
  • 集成是否已合并至 KerasHub 主分支,或以独立插件形式提供

开发者关注点

对于正在评估或已使用 KerasHub 进行模型训练、但寻求更高效在线推理方案的团队,建议关注后续官方仓库的更新日志与示例代码,以确认兼容性及性能收益是否符合预期。

信源