爱诗科技发布 PixVerse R2:把通用能力与实时生成统一进同一套因果框架
爱诗科技上线实时世界模型 PixVerse R2,采用 Omni Causal AR 与 Real-Time Accel…
爱诗科技近日上线其实时世界模型 PixVerse R2,试图在「实时性」与「通用能力」这两条长期难以兼得的路线上给出统一解法。R2 将视觉、动作、音频、时序与不同控制信号统一进同一套可持续扩展的因果建模框架,并在此基础上叠加专门的实时加速层。
为什么实时世界模型长期难以 Scaling
文章把行业困境拆成两层技术工程门槛。
第一层是表征难题:图像与视频是连续、高维、高度冗余的信息形态,相邻像素与帧之间存在大量重复,视觉领域缺少像文本 Token 那样紧凑且可序列化扩展的表示体系,因此视频与世界模型很难沿 LLM 那套「堆数据—堆参数—堆算力」的路径持续增长。
第二层是实时预算约束:每一帧留给模型的计算窗口往往只有几十毫秒,而世界模型理解复杂物理关系与长程时空变化又需要更大的模型容量,模型容量与实时计算预算天然互相拉扯。
文章以 Google DeepMind 的 Genie 2 为例:场景与物理能力扩展了,但要跑到实时往往需要通过蒸馏并以部分画质为代价。
R2 的核心思路:能力和实时分头强化
R2 的关键技术设计是把「能力上限」与「实时性」拆成两道独立工序:
- Omni Causal AR:负责能力上限。把短视频、长视频、多模态参考、音频与 Action 控制统一进一套因果自回归框架,并通过动态 Chunk 适配不同时间尺度,使用 Hybrid Teacher / Diffusion Forcing、多时间尺度记忆与 Error Bank 来缓解长程生成中的误差累积、角色漂移与状态断裂问题。
- Real-Time Acceleration:负责实时性。把 Omni Causal AR 学到的通用能力蒸馏进实时加速层,把世界理解逻辑压进实时预算。
文章将 Scaling 拆为五个协同增长的维度:模型规模、数据、任务、控制信号、时间尺度,并强调任意一个维度增加投入都能反过来增益其他维度,整体能力上涨而非只靠参数膨胀。
体验层面的表现
根据文章描述,R2 在以下几方面相对前代 R1 有提升:
- 生成质量与长程一致性更稳
- 跨场景泛化更强
- 多模态控制更细,例如通过 Prompt 实时改变场景、角色动作或剧情走向
- 支持赛博世界、互动影游、实时数字人等多种场景
文章强调 R2 在 WASD 视角控制与 Prompt 交互的组合下,延迟与卡顿问题得到改善。
行业意义
文章认为,R2 的「先放大能力、再做实时加速」路径如果成立,外溢价值不止于视频生成,还可能延伸到内容生产、具身智能、虚拟人、游戏实时渲染等场景,使互动娱乐进入「内容不再被完成」的阶段——剧情、场景与角色从预制资产转向可随用户行为持续演化的动态系统。
需要指出的是,原文未给出具体的参数量、推理延迟、benchmark 数据或与同类模型的横向对比,技术描述整体偏定性与宣传化。
