桃子桃子快讯
返回首页
模型发布

商汤发布 SenseNova U1.5 技术报告

商汤推出原生统一多模态模型 SenseNova U1.5,采用 8B 混合 Transformer 架构,开源训练方案,…

2026.09.17 · 周四3 分钟阅读

商汤于近日发布 SenseNova U1.5 技术报告,推出原生统一多模态模型 SenseNova U1.5,主打「能力共存」向「能力交互」的升级,定位为开源 8B 混合 Transformer(MoT)原生统一模型,强调理解与生成在同一框架下的深度耦合,而非简单的「看懂 + 画图」拼接。模型权重、推理代码与完整训练方案(SFT、RL 及多专家 On-Policy 蒸馏)同步开源,配套 SenseNova Studio 与 Token Plan 等产品入口开放使用。

架构与关键设计

U1.5 在模型结构层面做了几项关键改造:

  • 原生 MoT:理解与生成分支通过共享注意力机制连接,视觉与文本 token 在同一注意力层中交互,减少「双塔拼接」造成的语义断层。
  • 空间联合重建(Spatially Joint Reconstruction):采用 Pixel Shuffle 配合 3×3 空间卷积,实现原生 4K 图像生成,并在空间一致性上较前代明显增强。
  • 多专家 On-Policy 蒸馏:将美学、OCR、信息图、编辑等专项专家整合到统一模型中,避免多模型串联带来的风格与语义漂移。

能力交互与基准表现

报告着重呈现了「能力之间相互增强」的效果:

  • 推理 → 生成:在 WISE 基准上得分从 0.70 提升至 0.81,加入思维链(CoT)后生成质量与可控性进一步改善。
  • 生成 → 理解:RealUnify-GEU 指标从 47.5 提升至 56.3,相对 U1-SFT 提升近 9 个点。
  • 视觉推理:在 VBVR-Pro-Bench 上取得 68.2%,高于 Nano-Banana-Pro 的 56.4% 与 GPT-Image-2 的 50.7%。

开源与训练方案

U1.5 将训练全流程向社区开放,涵盖:

  • 监督微调(SFT)数据与配置
  • 强化学习(RL)阶段方案
  • 多专家 On-Policy 蒸馏流程
  • 模型权重与推理代码,分别托管在 Hugging Face 与 GitHub

开发者可直接下载 8B 参数的原生统一模型用于下游任务,也可通过 SenseNova Studio 与 Token Plan 接入在线服务。

行业定位

在原生统一多模态模型赛道上,U1.5 的差异化体现在两个方向:一是 8B 规模下的开源可用性,二是把「能力交互」作为模型设计的核心目标,而非仅做模态拼接。对中文开源多模态社区而言,这是少数提供完整训练配方而非仅放权重的方案,具备较高的复现与二次开发价值。

信源