桃子桃子快讯
返回首页
模型发布

商汤 SenseNova U1.5-Lite 完整版发布:专家训练 + OPD 蒸馏,单模型统一推理

商汤推出图像生成模型 SenseNova U1.5-Lite 完整版,通过任务专家训练与 OPD 蒸馏合并为单模型,多项…

2026.08.21 · 周五3 分钟阅读

商汤科技近日正式发布图像生成模型 SenseNova U1.5-Lite 完整版本。与此前的 Preview 版相比,新版本在保持单一推理模型的前提下,通过「任务专家训练 + OPD 蒸馏合并」的两阶段路线,把文字渲染、信息图、人像审美与图像编辑等专项能力整合进同一个模型,推理时无需路由器或人工切换专家。该模型同时开源了 8B 参数的 HuggingFace 权重与 GitHub 推理代码。

技术路线:专家训练,合并交付

U1.5-Lite 的核心思路是「specialized in training, unified in delivery」。团队首先为文字渲染与信息图、整体审美质量、图像编辑三类任务分别训练专家模型,再用 OPD(Omni-Expert Distillation)方法把这些专家能力蒸馏回单一模型。

  • 推理阶段只暴露一个模型,没有 router、没有专家切换、也不要求用户手动选专家。
  • 后训练阶段引入了面向任务的强化学习,三类用户可见目标分别是:指令遵循、视觉质量与偏好对齐、编辑保真度与未编辑区域保持。

基准表现

相比 Preview 版本,U1.5-Lite 完整版在三项公开基准上均取得明显提升:

  • Qwen-Image-Bench:47.14 → 60.18(PE 模式)
  • ImgEdit:3.9 → 4.59
  • GEdit-Bench-EN:7.47 → 8.26

能力升级

完整版在多个实际使用维度做了强化:

  • 复杂指令遵循:单条请求中同时给出主体、数量、空间关系、文字、版式、风格与保持要求时更稳定。
  • 文字渲染与密集版式:海报与信息图场景下的中英文渲染质量提升。
  • 原生 4K 生成:在高分辨率下保持全局结构稳定。
  • 原生编辑能力:在主体身份、几何结构与未编辑区域保持上更精细,支持多参考编辑与精确局部修改。
  • 理解反哺生成:来自视觉理解任务(物体关系、空间结构、版式、信息层级)的表征被用于辅助生成与编辑;JSON 结构化监督仅作为训练时的可控性手段,默认交互仍是自然语言。

开源与可用性

开发者可直接下载 8B 权重进行本地推理或二次微调,相关脚本与配置已在仓库中开放。对于关注文生图、可控编辑与高分辨率生成的应用方而言,这是一个在中端参数规模下、把多任务能力压缩到单模型中的可选方案。

信源