桃子桃子快讯
返回首页
开源

苹果发布 LensVLM-9B:基于 Qwen 的可选择性文本压缩视觉模型

Apple ML Research 在 Hugging Face 开源 9B 参数视觉语言模型 LensVLM,可扫描压…

2026.09.24 · 周四2 分钟阅读

苹果机器学习研究团队(Apple Machine Learning Research)近期在 Hugging Face 发布了 LensVLM-9B,这是一款基于 Qwen 架构进行改动的 9B 参数视觉语言模型,专注于处理"被压缩成图像的文本"这一特殊场景。

核心思路:先粗扫、再选择展开

LensVLM 的设计目标是降低长文档场景下的视觉 token 消耗。它的工作流程分两步:

  • 首先扫描文本的压缩图像版本(即文本以较低分辨率被编码为图像)。
  • 当模型判断某些页面与查询相关时,再通过学习到的工具,将这一部分"关键页面"选择性还原为未压缩的高分辨率图像。

这种"先粗看、再细看"的策略,让模型在不显著增加视觉上下文长度的前提下保留关键信息。

苹果的基座选择:Qwen + 自研改造

LensVLM 的模型权重是 Apple 对 Qwen 模型进行定制后的版本,权重采用 Apple Machine Learning Research Model License 发布,源代码则单独以 Apple Sample Code License 授权。苹果选择在开源基座上构建研究型 VLM,而非完全自研底层架构,这一点值得社区关注。

配套资源

  • 论文:LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
  • 代码仓库:github.com/apple-aiml-research/ml-lensvlm
  • GGUF 量化版:社区用户 bartowski 已发布 GGUF 格式的量化权重,方便本地推理框架直接加载

适用场景与注意

该模型面向长文档、扫描件、PDF 等以压缩文本图像形式存在的内容,适合需要处理大量文档图像、又希望控制视觉上下文开销的研究者与开发者。需要注意的是,权重使用 Apple 自定义研究许可,在商用前应仔细核实授权条款。

信源