桃子桃子快讯
返回首页
模型发布

Liquid AI 发布 LFM2.5-VL-3B 多模态模型,主打端侧部署

Liquid AI 在 Hugging Face 开源 3B 多模态模型 LFM2.5-VL-3B,主打端侧部署,在 A…

2026.08.12 · 周三3 分钟阅读

Liquid AI 在 Hugging Face 上正式发布了多模态模型 LFM2.5-VL-3B,这是其面向端侧部署的 LFM2.5 系列中的视觉语言版本。该模型基于 LFM2-VL-3B 进一步做了中训练与后训练,融合了 LFM2.5-2.6B 语言模型主干与 SigLIP2 NaFlex 视觉编码器,可同时处理文本与图像输入。

模型规格

LFM2.5-VL-3B 的关键参数如下:

  • 语言模型主干:LFM2.5-2.6B
  • 视觉编码器:SigLIP2 NaFlex 形状优化版,约 400M 参数
  • 词表大小:128,000
  • 上下文长度:32,768 tokens
  • 支持语言:英语、阿拉伯语、中文、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语、越南语、泰语、印尼语、印地语、俄语、波兰语

在图像处理上,模型利用 SigLIP2 NaFlex 的原生分辨率能力:大图会被切分为不重叠的 512×512 切片,并附加一张缩略图作为整体参考。生成参数方面,文本模式推荐 temperature=0.2、top_k=50、repetition_penalty=1.0;视觉模式的具体配置可参考仓库中的 processor_config.json。

核心能力

相比前代 LFM2-VL-3B,新版本重点强化了三方面能力:

  • 更好的 Grounding:提升对自然语言查询的目标定位与物体检测能力。
  • 更好的 OCR:支持整页 OCR,并附带版面标注(layout annotation),便于将扫描文档或 PDF 转为可检索文本。
  • 更高效的推理:在 Apple M5 Max 上达到 228 tokens/s,在 AMD Ryzen AI Max+ 395 上达到 116 tokens/s,峰值显存占用低于 3.3 GB;在三星 Galaxy S26 Ultra 上也能跑到约 20 tokens/s,实现完全端侧运行。

官方建议将模型用于单轮、高吞吐、低延迟的场景,例如车内近实时物体检测、带版面信息的批量文档 OCR,以及菜单、路牌等内容的端侧翻译。官方明确不建议将其用于长上下文、推理密集型任务,例如视觉化网页设计或对蓝图的深度技术问答。

GPU 推理表现

除端侧表现外,官方也披露了在单张 NVIDIA H100 上使用 vLLM 推理时的吞吐数据:在高并发下,LFM2.5-VL-3B 是 Liquid AI 测试过的所有模型中输出吞吐最高的之一,约 11,000 tokens/s,相当于每天近 10 亿 tokens。

适用场景与定位

整体来看,LFM2.5-VL-3B 的定位偏向"小而精"的端侧多模态方案:参数规模仅 3B 级,但在主流 PC、移动 SoC 上都能跑出可观速度,并在 OCR 与目标检测等垂直任务上做了针对性优化。对于需要在本地完成视觉理解的开发者,这是一个值得关注的轻量选项。

信源