4DGS-JEPA:为动态高斯泼溅引入时序可组合预测架构
研究人员提出 4DGS-JEPA,将联合嵌入预测(JEPA)思想与动态高斯泼溅结合,实现对 3D 场景未来状态的多步预测…
动态高斯泼溅(Dynamic Gaussian Splatting,简称 4DGS)能够以显式方式表达随时间演化的 3D 场景,但现有工作大多聚焦于重建、未来帧生成或高质量渲染,而非学习可复用的动力学。近日发表于 arXiv 的论文《4DGS-JEPA》提出,将联合嵌入预测架构(JEPA)的思路引入动态高斯泼溅领域,从而让模型在潜空间中学习 3D 世界的可预测动力学,而非仅仅记忆像素外观。
核心思路:时序可组合的潜空间预测
论文的核心原则被作者概括为「时序组合(temporal composition)」:当不同的时序转移路径抵达同一个未来时间点时,它们所产生的预测潜状态应当彼此兼容,而不是因路径选择不同而出现显著分歧。为支撑这一性质,作者设计了一个层级化表征:
- 场景级(scene-level):全局上下文;
- 运动组级(motion-group-level):将高斯按运动一致性分组;
- 高斯级(Gaussian-level):最细粒度的个体单元。
在此之上,模型引入一个「步长条件(horizon-conditioned)的转移算子」,同时支持直接预测与递归式多步展开(rollout)。
监督信号与几何一致性
为了让学到的动力学真正可预测未来,而非只还原已有观测,作者采用了端点监督与多步路径监督:
- 端点监督:将模型潜状态锚定到未来时刻的目标嵌入;
- 路径监督:约束不同路径到达同一终点时的潜空间一致性;
- 选择性几何解码器:在不要求完整重建未来外观的前提下,仅解码出与运动组和高斯几何相关的物理一致结构,使学习到的动力学被几何层面的组合性所约束。
此外,论文还提出一种「混合对应机制」,在保持持久规范身份(persistent canonical identity)的同时,叠加基于最优传输的残差匹配,以应对高斯在时间维度上的重排与拓扑变化。
理论分析与实验验证
在理论层面,作者刻画了「零损失路径一致性(zero-loss path agreement)」与「有限误差的递归展开累积」,为多步预测提供了误差传播层面的形式化保证。
在实验层面,论文设置了三个受控实验,分别给出机制层面的证据:
- 时序组合有效降低了潜空间对路径选择的依赖,同时不损害预测精度;
- 几何级组合提升了解码运动的跨时间一致性;
- 混合对应机制在身份明确时保持可靠匹配,在对应变得模糊时仍具有鲁棒性。
定位与意义
4DGS-JEPA 的目标并非生成像素级的精美未来画面,而是构建一种「可预测、可组合」的动态高斯世界表征。论文强调,该架构提供的是一种面向预测的、时序组合式的世界模型公式化表达,可作为后续在动态 3D 场景中进行规划、决策与因果推理研究的基座。
论文编号为 arXiv:2609.25036v1,所属分类为 cs.AI,目前为预印本版本,相关完整 benchmark 与定量对比有待全文与后续工作进一步披露。
