Liquid AI 发布 LFM2.5-VL-3B 多模态模型,主打端侧部署
Liquid AI 在 Hugging Face 开源 3B 多模态模型 LFM2.5-VL-3B,主打端侧部署,在 A…
Liquid AI 在 Hugging Face 上正式发布了多模态模型 LFM2.5-VL-3B,这是其面向端侧部署的 LFM2.5 系列中的视觉语言版本。该模型基于 LFM2-VL-3B 进一步做了中训练与后训练,融合了 LFM2.5-2.6B 语言模型主干与 SigLIP2 NaFlex 视觉编码器,可同时处理文本与图像输入。
模型规格
LFM2.5-VL-3B 的关键参数如下:
- 语言模型主干:LFM2.5-2.6B
- 视觉编码器:SigLIP2 NaFlex 形状优化版,约 400M 参数
- 词表大小:128,000
- 上下文长度:32,768 tokens
- 支持语言:英语、阿拉伯语、中文、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语、越南语、泰语、印尼语、印地语、俄语、波兰语
在图像处理上,模型利用 SigLIP2 NaFlex 的原生分辨率能力:大图会被切分为不重叠的 512×512 切片,并附加一张缩略图作为整体参考。生成参数方面,文本模式推荐 temperature=0.2、top_k=50、repetition_penalty=1.0;视觉模式的具体配置可参考仓库中的 processor_config.json。
核心能力
相比前代 LFM2-VL-3B,新版本重点强化了三方面能力:
- 更好的 Grounding:提升对自然语言查询的目标定位与物体检测能力。
- 更好的 OCR:支持整页 OCR,并附带版面标注(layout annotation),便于将扫描文档或 PDF 转为可检索文本。
- 更高效的推理:在 Apple M5 Max 上达到 228 tokens/s,在 AMD Ryzen AI Max+ 395 上达到 116 tokens/s,峰值显存占用低于 3.3 GB;在三星 Galaxy S26 Ultra 上也能跑到约 20 tokens/s,实现完全端侧运行。
官方建议将模型用于单轮、高吞吐、低延迟的场景,例如车内近实时物体检测、带版面信息的批量文档 OCR,以及菜单、路牌等内容的端侧翻译。官方明确不建议将其用于长上下文、推理密集型任务,例如视觉化网页设计或对蓝图的深度技术问答。
GPU 推理表现
除端侧表现外,官方也披露了在单张 NVIDIA H100 上使用 vLLM 推理时的吞吐数据:在高并发下,LFM2.5-VL-3B 是 Liquid AI 测试过的所有模型中输出吞吐最高的之一,约 11,000 tokens/s,相当于每天近 10 亿 tokens。
适用场景与定位
整体来看,LFM2.5-VL-3B 的定位偏向"小而精"的端侧多模态方案:参数规模仅 3B 级,但在主流 PC、移动 SoC 上都能跑出可观速度,并在 OCR 与目标检测等垂直任务上做了针对性优化。对于需要在本地完成视觉理解的开发者,这是一个值得关注的轻量选项。
