桃子桃子快讯
返回首页
开源

国产世界模型登顶李飞飞团队WorldScore榜单

兔展智能联合北大、鹏城实验室的UniWorld-View登顶WorldScore榜单,代码与权重全部开源,已适配国产昇腾…

2026.07.24 · 周五4 分钟阅读

国产世界模型登顶李飞飞团队WorldScore榜单

兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 在李飞飞团队维护的世界模型评测榜单 WorldScore 上跃居榜首。模型已适配国产昇腾算力,代码与权重全部开源,主打从单张图像或单目视频生成相机轨迹可控的新视角视频,并以同一套代码、同一个模型兼顾单图 3D 生成与视频 4D 生成。训练数据来自北大系初创企业元空智能。

新视角合成的核心难点

新视角合成(Novel View Synthesis)要求 AI「脑补」未拍摄的视角,难度集中在「大基线」场景:仅给模型看正脸,需要画出侧脸甚至后脑勺。传统 NeRF、3DGS 路线依赖多视角重建,在单目输入下视角覆盖几乎为零,容易出现空洞与伪影;纯生成式路线把相机位姿当作抽象条件向量塞进扩散模型,没有显式 3D 建模,转大角度便会失控。

近两年出现的折中路线是先用几何模型把画面撑成 3D 点云,再将目标视角的点云渲染图喂给视频扩散模型,ViewCrafter、英伟达 GEN3C 走的就是这条路。但该路线在点云渲染一步存在两类经典穿帮:深度边界处的前景背景撕裂,以及缺少面信息导致的背面漏光。小幅度换视角时尚可糊弄,上了大基线便会带偏生成结果。

遮挡感知点云渲染

UniWorld-View 的第一板斧砍向点云渲染的穿帮问题。

  • 双重投影(Double-Reprojection):把源画面投影到目标视角,再原路投影回源视角,凡是「回不来」的像素即被视为遮挡区域,沿相机轨迹逐帧累积为 mask,渲染时直接挖掉,让生成模型去补而不是被错误纹理误导。
  • 法向过滤:为每个点估计法向量,与视线方向计算夹角,背向相机的点直接剔除,解决「隔着后脑勺看到正脸」的背面漏光。

两招叠加后,条件图中的错误几何信号被显著清理,只剩下可靠几何与明确的待补区域。

双分支条件注入

几何理顺后,团队仍要解决「位置对但内容缺」与「内容全但位置不对」这对矛盾,于是设计了双流条件注入:

  • 几何流:点云渲染图与 mask 编码后叠加到潜变量,负责把生成内容钉死在 3D 结构上;
  • 外观流:源视频走新设计的 Ref-DiT 模块,新视角特征作 Query、源视频特征作 Key/Value 做 cross-attention,让模型自行从原视频中翻找素材补缺,并顺手修复点云伪影造成的糊纹理。

一个管构图、一个管上色,分工明确。

从单目视频到 4D 场景

UniWorld-View 把相机运动与时间推进解耦,分两步生成多视角视频:先冻结首帧绕场生成一组静态「定妆照」作为外观锚点,再在固定机位上生成同步多视角视频,前景自遮挡通过迭代生成逐步补全;将得到的多视角视频喂给 4DGS 优化,即可重建动态 3D 场景,实现从单目随手拍到自由视角漫游 4D 场景的完整链路。

关于兔展智能

兔展智能由北大校友与北大视觉领域青年领军人才联合创立,专注视觉 AI 大模型研发。此前已开源 Open-Sora Plan(2024 年代码引用量居全球第一)与 UniWorld 系列模型;UniWorld-V2、V2.5 分别于 2025 年与 2026 年 4 月发布。公司近期计划推出产模一体设计生产工具 RabbitVis,将视觉大模型能力推向商业设计工作流。

信源