桃子桃子快讯
返回首页
开源

商汤开源8B生图模型SenseNova U1.5 Lite正式版

商汤发布SenseNova U1.5 Lite正式版,8B参数,支持4K输出、复杂指令遵循与图像编辑,在多项能力上对标闭…

2026.08.25 · 周二3 分钟阅读

商汤科技日前正式开源图像生成模型 SenseNova U1.5 Lite 正式版。该模型仅 8B 参数,在复杂指令遵循、原生图像编辑、文本与版式排版等核心场景中宣称可与闭源的 GPT-Image-2 比肩,同时保持轻量部署优势。

模型核心能力

SenseNova U1.5 Lite 正式版相较三周前发布的 Preview 版本,重点强化了多项能力:

  • 超长复杂指令遵循:可一次理解 3-4k 字符的需求,同时处理主体、数量、位置、文字、布局和风格等多种约束。
  • 原生 4K 高分辨率输出:直接生成 4K 图像,同时保留构图、纹理、小字和光影细节。
  • 原生图像编辑:在修改指定区域时更精准,同时更好地保持人物、结构、版式和其他区域不变。
  • 文字与复杂布局:中英文文字、海报、信息图和多文本排版的准确度提升。
  • 多模态视觉控制:支持框选、标记和多图参考,更准确地指定「改哪里、改什么」。

官方演示中,模型可一次处理九张不同食物照片并拼成食谱分享卡片,也可对卧室场景进行局部修改而保留整体空间关系。

技术架构:先拆开练,再合回来

SenseNova U1.5 Lite 沿用 NEO-unify 原生统一多模态架构,将视觉理解、图像生成和编辑置于同一套模型中。模型在动像素之前先完成画面理解,识别主体、空间关系、文字区域和参考图中需要保留的设计逻辑。

正式版的关键变化发生在训练阶段。商汤采用「先拆开练,再合回来」的策略:文字渲染、美学表达、图像编辑等目标先分别训练对应的专项 Expert,再通过多教师在线策略蒸馏技术 MOPD 把这些能力融合回同一个 8B 模型。

这一做法使得用户调用时无需额外 Router 判断任务归属,也无需在不同子模型之间切换。商汤将其概括为「理解与生成双向反哺」。

后训练阶段则专门强化了三项能力:

  • 指令遵循:确保复杂需求中的每条要求都被执行。
  • 视觉偏好:保证构图、材质、光影和最终质感过关。
  • 编辑保持:精确修改目标区域,同时维持非编辑区域不变。

此外,模型还引入提示词增强(PE)机制,可在用户给出简短需求时自动补充完整创作方案。

从惊艳到稳定:生图模型的评价标准

商汤认为,当 AI 生图能力日趋普及,真正决定模型能否进入工作流的不再只是「第一眼够不够惊艳」,而是从生成到交付的完整链路是否稳定。SenseNova U1.5 Lite 正式版的核心目标正是把铺开的能力收拢进一个统一模型,做到调用链路更短、部署更轻、任务之间一致性更高。

落到开发者和创作者的实际使用中,这一策略对应的是「快、好、省」三个字。商汤表示,多模态仍是 AI 走向物理世界、进入生产环节的重要方向,稳定性、指令遵循和编辑精度将直接决定模型能否被真正用起来。

开源与体验入口

SenseNova U1.5 Lite 现已开源,资源链接如下:

信源