开源
苹果发布 LensVLM-9B:基于 Qwen 的可选择性文本压缩视觉模型
Apple ML Research 在 Hugging Face 开源 9B 参数视觉语言模型 LensVLM,可扫描压…
2026.09.24 · 周四约 2 分钟阅读
苹果机器学习研究团队(Apple Machine Learning Research)近期在 Hugging Face 发布了 LensVLM-9B,这是一款基于 Qwen 架构进行改动的 9B 参数视觉语言模型,专注于处理"被压缩成图像的文本"这一特殊场景。
核心思路:先粗扫、再选择展开
LensVLM 的设计目标是降低长文档场景下的视觉 token 消耗。它的工作流程分两步:
- 首先扫描文本的压缩图像版本(即文本以较低分辨率被编码为图像)。
- 当模型判断某些页面与查询相关时,再通过学习到的工具,将这一部分"关键页面"选择性还原为未压缩的高分辨率图像。
这种"先粗看、再细看"的策略,让模型在不显著增加视觉上下文长度的前提下保留关键信息。
苹果的基座选择:Qwen + 自研改造
LensVLM 的模型权重是 Apple 对 Qwen 模型进行定制后的版本,权重采用 Apple Machine Learning Research Model License 发布,源代码则单独以 Apple Sample Code License 授权。苹果选择在开源基座上构建研究型 VLM,而非完全自研底层架构,这一点值得社区关注。
配套资源
- 论文:LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
- 代码仓库:github.com/apple-aiml-research/ml-lensvlm
- GGUF 量化版:社区用户 bartowski 已发布 GGUF 格式的量化权重,方便本地推理框架直接加载
适用场景与注意
该模型面向长文档、扫描件、PDF 等以压缩文本图像形式存在的内容,适合需要处理大量文档图像、又希望控制视觉上下文开销的研究者与开发者。需要注意的是,权重使用 Apple 自定义研究许可,在商用前应仔细核实授权条款。
