桃子桃子快讯
返回首页
开源

omlab 开源 10B 视觉定位模型 VLX-Seek-1.5,主打具身场景

omlab 在 Hugging Face 发布 VLX-Seek-1.5-10B 开源模型,将视觉定位重构为区域检索与区…

2026.08.10 · 周一3 分钟阅读

omlab 在 Hugging Face 上发布了 VLX-Seek 1.5 系列的开源 10B 模型 VLX-Seek-1.5-10B,定位为面向具身智能场景的细粒度视觉感知与视觉定位(visual grounding)模型,目标是让机器人在真实环境中既能「认出有什么」,也能「找对实例」,并对不存在的目标给出明确拒绝。

模型背景与设计思路

与常见的「直接解码边界框坐标」的视觉语言模型不同,VLX-Seek 把定位任务重构为「区域检索 + 区域引用」。候选视觉区域被表示为可寻址的实体,模型通过比较、选择、引用这些区域来作答,而不是生成脆弱的坐标字符串。模型团队认为这种方式更贴合语言模型擅长的比较、选择、引用与推理能力。

技术上,VLX-Seek-1.5-10B 在视觉感知栈上做了升级,包括更强的辅助视觉塔、改进的视觉-语言对齐层和更强的 VLM 主干;同时引入更快的 OPN 候选生成方案和更多 Linear Attention 层,以提升推理效率并降低显存占用。

主要特性

  • 面向具身的视觉定位:针对无人机视角、监控视角、机器人视角等边缘端感知场景优化。
  • 区域引用式定位:将候选区域转为语言可寻址的 region token,减少对坐标字符串生成的依赖。
  • 升级的视觉能力:辅助视觉塔、对齐层与 VLM 主干均得到加强。
  • 更快的推理:改进 OPN 候选生成、增加 Linear Attention 层,提升效率与降低显存。
  • 显式拒绝不存在目标:通过 hard-negative 训练与显式 None 输出格式,降低「幻觉式定位」。
  • 多尺寸家族:1.5 系列规划 0.6B、3B、10B,本次发布的为 10B 权重。

适用场景

官方给出的预期用途包括开放词表目标检测与定位、指代表达理解、多目标视觉 grounding、带区域证据的目标计数、无人机视角下小目标密集场景的感知、机器人中心与具身空间推理,以及边缘端或机器人基站部署的视觉感知模块,并特别适合需要「显式拒绝不存在目标」的实验。

已知局限

  • 模型依赖上游候选区域,若候选召回不足,即便语言理解正确也可能定位失败。
  • 区域引用输出需配合 VLX-Seek 后处理流水线,才能将 region token 映射回图像坐标。
  • 在严重遮挡、极端模糊、低分辨率、传感器异常或高度歧义的指代表达下仍可能出错。
  • hard-negative 训练可减少目标幻觉但无法完全消除,高影响部署仍需校验与人审。

项目地址与推理代码、运行示例见官方 GitHub 仓库 om-ai-lab/VLX-Seek,权重与模型卡已在 Hugging Face 公开。

信源