桃子桃子快讯
返回首页
模型发布

LFM2.5-VL-3B 发布,主打端侧多模态

Liquid AI 发布 3B 视觉语言模型,主打本地硬件运行,强化屏幕理解、目标定位与函数调用能力。

2026.08.12 · 周三4 分钟阅读

Liquid AI 在 Hugging Face 博客发布新一代视觉语言模型 LFM2.5-VL-3B,参数量约 3.1B,定位为可在本地硬件运行的轻量级多模态模型,支持文档与屏幕理解、目标定位、多图输入和函数调用,面向需要实时响应的端侧与设备端应用。模型直接给出答案而非经过长链推理,以保证实时与设备端应用的响应速度。

核心能力升级

相比前代 LFM2-VL-3B,新模型在四个方向有显著提升:

  • 屏幕/UI 理解:跨设备的数字屏幕内容识别能力增强。
  • 目标定位:通过自然语言查询进行更准确的物体检测。
  • 多图输入:跨多张图像的推理能力改善。
  • 函数调用:纯文本及视觉-文本场景下的工具调用能力显著增强。

架构与训练方法

LFM2.5-VL-3B 由 SigLIP2 400M NaFlex 视觉编码器与 LFM2.5-2.6B 文本模型主干组合而成。预训练数据规模约 34T token,其中视觉数据量为上一代的 4 倍,来源包括筛选与合成的图像-文本对、OCR、目标定位与指令跟随数据集。为支持非拉丁语系,词表扩展到 128K,通过原地扩展 tokenizer 实现,无需从头训练。

后训练分两阶段:第一阶段为监督微调(SFT),采用知识蒸馏以及 Antidoom 训练;第二阶段为多奖励强化学习(RL)。

基准测试表现

Liquid AI 在视觉与文本两大类基准上对 LFM2.5-VL-3B 进行了评测。视觉基准覆盖多语言视觉理解、指令跟随、视觉数学与科学推理、文档理解、目标检测、多图理解与屏幕理解。官方表示,在真实世界图像任务上,LFM2.5-VL-3B 在同类尺寸模型中处于领先位置,对数字内容——文档、图表到屏幕 UI 元素——也有良好识别能力。

部分视觉基准对比(数值为 0–100 归一化分数):

  • RealWorldQA:LFM2.5-VL-3B 73.1,前代 71.1
  • DocVQA (val):91.1,前代 89.8
  • OCRBench v1:84.2,前代 81.7
  • RefCOCO-avg(目标定位):87.9,前代 57.1,定位能力大幅提升
  • ScreenSpot-v2 Desktop:78.7,前代 6.0
  • ScreenSpot-v2 Mobile:81.2,前代 7.6
  • ScreenSpot-v2 Web:82.2,前代 2.5

整体平均得分 69.4,较前代的 57.2 提升显著,与 InternVL 3.5 4B 并列领先,略低于 Qwen3.5-4B 的 70.1。

文本基准方面,指令跟随与工具调用能力均明显改善:

  • IFEval:82.3,前代 72.9
  • Multi-IF:59.4,前代 46.5
  • ToolSandbox:59.5,前代 26.4,与 Gemma-4-E2B、Qwen3.5-2B 相当
  • BFCL V4:32.5,前代 20.5

所有评测使用 vLLM 0.26.0 与各模型推荐生成参数,采用非推理模式进行直接作答。

推理速度与生态支持

LFM2.5-VL-3B 在推理生态中具备发布即支持特性,覆盖 llama.cpp、MLX、vLLM、SGLang 与 ONNX。

端侧推理性能:

  • Apple M5 Max:228 tokens/s
  • Ryzen AI Max+ 395:116 tokens/s
  • Galaxy S26 Ultra:20 tokens/s
  • 显存/内存占用约 3 GB

GPU 推理方面,模型在多帧输入上保持稳定低延迟,是评测模型中输出吞吐最高的之一。在高并发场景下输出可达约 11K tokens/s,约为 4B 级别模型的两倍,可在一台机器上每天输出接近 10 亿 token。综合来看,LFM2.5-VL-3B 是一款面向边缘与设备端场景、以速度与屏幕/文档理解为核心卖点的通用多模态模型。

信源