商汤 SenseNova-Vision 开源:7B 模型统一处理十余种视觉任务
商汤发布 7B 开源视觉模型 SenseNova-Vision,以统一架构覆盖检测、分割、深度、OCR 及 3D 重建等…
商汤于 7 月 8 日在 GitHub 与 Hugging Face 开源了 SenseNova-Vision,这是一款 7B 参数的统一视觉模型,采用 Apache 2.0 协议。模型最大的特点是把目标检测、分割、深度估计、OCR、关键点、相机位姿乃至多视图三维重建等十余类视觉任务,统一为「同一套权重 + 一段自然语言指令」的生成式框架,不再依赖任务专属的检测头或解码器。
统一架构:以生成代替专用头
传统计算机视觉工作流通常需要为不同任务配置专用模型与解码器。SenseNova-Vision 的核心思路是将几乎所有视觉任务重新表述为生成问题。用户给出一段自然语言指令(必要时附带视觉提示),模型即可输出文本、图像或二者兼有:
- 文本输出:类别标签、边界框、OCR 文本、关键点、相机角度等结构化信息
- 图像输出:分割掩码、深度图、表面法线、多视图点云
- 可组合输出:上述两种模态自由组合,覆盖更复杂的下游任务
这种设计让用户只需切换提示词,就能在同一模型上完成从 2D 感知到 3D 重建的不同任务。
能力亮点:3D 重建与相机位姿
除常规的物体检测、关键点、OCR、二值/实例/语义分割、深度与表面法线估计外,模型在最新版本中加入了多视图三维重建和相机位姿估计能力,并为此新增了专项 benchmark。开发者通常需要 COLMAP 等专用工具才能从多张图像中恢复三维结构,而 SenseNova-Vision 试图用单一提示词直接完成这一过程。如果实测效果稳定,将降低 3D 重建的使用门槛。
训练数据与硬件门槛
模型训练数据来自约 5000 万条「指令—响应」对,整合自不同来源的视觉标注;底层起点是一个已有的多模态模型,并未引入全新架构,因此可以理解为在通用多模态基座上做的视觉统一化扩展。
硬件方面门槛较高:
- Web Demo 完整运行需要单卡 80GB 显存
- 复现 benchmark 推荐 8×80GB 配置
- 普通消费级显卡难以本地运行
此外,项目方同步开源了训练流程与数据准备代码,便于研究者自行训练或微调。
开源资源与社区反应
SenseNova-Vision 的权重与训练代码已发布在 GitHub 仓库 OpenSenseNova/SenseNova-Vision,模型权重同步托管在 Hugging Face,社区同时提供了可交互的 Web Demo。作为发布仅数日的项目,多视图重建部分在真实自有图像上的表现仍待验证,但 Apache 2.0 协议与开源训练管线为后续研究和工程落地提供了相对宽松的起点。
