模型发布
商汤发布 SenseNova U1.5 技术报告
商汤推出原生统一多模态模型 SenseNova U1.5,采用 8B 混合 Transformer 架构,开源训练方案,…
2026.09.17 · 周四约 3 分钟阅读
商汤于近日发布 SenseNova U1.5 技术报告,推出原生统一多模态模型 SenseNova U1.5,主打「能力共存」向「能力交互」的升级,定位为开源 8B 混合 Transformer(MoT)原生统一模型,强调理解与生成在同一框架下的深度耦合,而非简单的「看懂 + 画图」拼接。模型权重、推理代码与完整训练方案(SFT、RL 及多专家 On-Policy 蒸馏)同步开源,配套 SenseNova Studio 与 Token Plan 等产品入口开放使用。
架构与关键设计
U1.5 在模型结构层面做了几项关键改造:
- 原生 MoT:理解与生成分支通过共享注意力机制连接,视觉与文本 token 在同一注意力层中交互,减少「双塔拼接」造成的语义断层。
- 空间联合重建(Spatially Joint Reconstruction):采用 Pixel Shuffle 配合 3×3 空间卷积,实现原生 4K 图像生成,并在空间一致性上较前代明显增强。
- 多专家 On-Policy 蒸馏:将美学、OCR、信息图、编辑等专项专家整合到统一模型中,避免多模型串联带来的风格与语义漂移。
能力交互与基准表现
报告着重呈现了「能力之间相互增强」的效果:
- 推理 → 生成:在 WISE 基准上得分从 0.70 提升至 0.81,加入思维链(CoT)后生成质量与可控性进一步改善。
- 生成 → 理解:RealUnify-GEU 指标从 47.5 提升至 56.3,相对 U1-SFT 提升近 9 个点。
- 视觉推理:在 VBVR-Pro-Bench 上取得 68.2%,高于 Nano-Banana-Pro 的 56.4% 与 GPT-Image-2 的 50.7%。
开源与训练方案
U1.5 将训练全流程向社区开放,涵盖:
- 监督微调(SFT)数据与配置
- 强化学习(RL)阶段方案
- 多专家 On-Policy 蒸馏流程
- 模型权重与推理代码,分别托管在 Hugging Face 与 GitHub
开发者可直接下载 8B 参数的原生统一模型用于下游任务,也可通过 SenseNova Studio 与 Token Plan 接入在线服务。
行业定位
在原生统一多模态模型赛道上,U1.5 的差异化体现在两个方向:一是 8B 规模下的开源可用性,二是把「能力交互」作为模型设计的核心目标,而非仅做模态拼接。对中文开源多模态社区而言,这是少数提供完整训练配方而非仅放权重的方案,具备较高的复现与二次开发价值。
