爱诗科技发布PixVerse R2,宣称首个可扩展实时世界模型
爱诗科技发布PixVerse R2,号称首个具备Scaling能力的通用实时世界模型,已开放游戏、互动影视、数字人等场景…
爱诗科技(AIsphere)近日正式发布 PixVerse R2,宣称这是全球首个具备 Scaling 能力的通用实时世界模型,并向用户开放游戏、互动影视及数字人等多个场景的体验入口。该模型基于爱诗自研的 Omni Causal AR(全模态因果自回归)与 Real-Time Acceleration(实时加速)两层架构,试图在「实时」与「通用」之间走出一条可以持续扩展的技术路径。上线后,PixVerse R2 迅速登上 X(Twitter)美区热搜。
技术突破:让 Scaling 适用于连续高维视频信号
ChatGPT 用 Scaling Laws 证明了「模型越大、能力越强」,但过去业界普遍认为,这条定律只适用于语言这样的离散符号。视频属于连续高维信号,天生难以扩展——要做实时,模型必须小且快;要做通用,模型必须大且见多广。两条要求看似矛盾,传统思路只能在两者间取舍。
爱诗科技认为,关键在于把「能力」和「效率」解耦。只要架构设计正确,当文本、参考、声音、操作等复杂信号能被模型统一「理解」,实时世界模型同样可以「越大越强」。PixVerse R2 即是对这一思路的验证——「实时」与「通用」可以兼得,且实时并非「偷工减料」的妥协,而是一条可以持续变强的技术路线。
核心能力:五维 Scaling 与体验升级
PixVerse R2 的 Scaling 不是简单地把参数变大,而是同时发生在模型、数据、任务、控制信号、时间尺度五个维度上。这些维度相互增强,带来三方面核心能力提升:
- 生成质量更高:画面更精细、运动更自然、音视频同步更精准。
- 长程一致性更强:角色不崩、场景不跳、物体不凭空消失,长时间运行下世界状态保持稳定。
- 多模态控制能力更强:文字、参考图、声音、键盘操作均能被稳定理解并触发反应。
用户体验层面,PixVerse R2 强调「言出法随」——虚拟世界能够「有记忆地活着」、听懂语言指令,并对用户动作做出符合因果关系的反应。用户可通过 WASD 控制角色移动、跳跃、换视角,也能直接输入 Prompt 换角色、加东西、改环境,过程中角色、物体和环境之间还会产生符合空间关系与物理逻辑的互动。
架构创新:从「五层接力」收敛为「两个引擎」
过去做实时世界模型的常见路径是「为了实时不得不降低质量」:训练需经过「五层接力」,每一层都会折损画质、动作和指令理解能力,且规模和任务越大,流程越容易散架。
爱诗科技将整套训练框架收敛为两个核心引擎:
- Omni Causal AR(能力引擎):持续吸收更多数据、任务与更长的时间跨度,把世界模型的理解力和表现力训练到最强。
- Real-Time Acceleration(加速引擎):把已经练到最强的能力,尽可能无损地压缩进严格的实时延迟约束里。
围绕两个引擎,工程细节上还有针对性设计。能力引擎一侧,Dynamic Chunk 让文字、图像、语音、操作等不同节奏信号被统一处理;多时间尺度记忆同时保留「世界长什么样」和「刚刚发生了什么」;Error Bank 专门收集模型跑偏状态反复训练,实测让长期画面漂移下降约 35.8%。加速引擎一侧,教师与学生模型共用同一套因果基础;块稀疏注意力稀疏度超 90% 仍几乎不损失效果;金字塔式分阶段生成先定结构、再补细节。
公司底座与未来规划
爱诗科技 2023 年成立,早于 Sora 推出自研视频大模型,旗下 PixVerse V 系列、C 系列模型长期稳居行业第一梯队。PixVerse R2 的基础模型经过全球亿级用户的真实使用与反馈打磨,创始人王长虎此前在短视频领域负责大规模实时系统建设与运维的经验也被迁移到世界模型的训练与推理架构中。
王长虎表示,PixVerse R2 仍处于发展初期,在严格实时约束下单次生成质量与前沿离线视频模型相比仍有提升空间,但其底层架构与技术路径已经过验证,具备持续迭代的坚实基础。未来,爱诗科技将在模型、数据、任务、控制信号、时间尺度五个维度持续投入,推动实时世界模型从创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界模型的基础设施。
