Runway 公布 GWM Worlds 2:支持实时交互的通用世界模型
Runway 在 X 平台公开 GWM Worlds 2 研究成果,可在 720p / 24fps 视频与 48kHz…
Runway 于社交平台 X 上公布了其在通用世界模型(General World Model)方向的最新研究成果 GWM Worlds 2。该模型能够在连续 720p 视频、24 fps 帧率以及 48000 Hz 音频条件下,实时生成可交互的仿真世界,被 Runway 定位为其基础音视频生成模型之上的下一代研究。
核心能力:可定义、可操控的连续世界
GWM Worlds 2 的核心思路是把「世界」本身作为生成对象,而不是生成固定时长的视频片段。用户可以在进入世界之前,自主定义以下要素:
- 环境(environment)
- 主体(subjects)
- 视觉风格(visual style)
- 物理规则(physical rules)
- 环境氛围(ambience)
在进入世界后,模型支持两种主要控制方式:一是针对任意主体或场景本身发出文字指令(text actions),二是持续的相机运动控制。与传统按固定脚本或预设时长播放的生成视频不同,GWM Worlds 2 会基于每一次新的输入持续延展世界,因此单次会话没有预设时长限制。
技术规格与定位
根据官方描述,GWM Worlds 2 的输出规格为:
- 视频:720p 分辨率、24 fps
- 音频:48000 Hz
- 形式:实时、连续、可交互的仿真
Runway 将其定位为「基础音视频生成模型」之上的扩展,意味着 GWM Worlds 2 并非从零训练的独立模型,而是构建在 Runway 已有音视频生成能力之上的一次方向性探索。
目标应用场景
Runway 在公告中给出了 GWM Worlds 2 的预期落地方向,主要涵盖:
- 交互式娱乐(interactive entertainment)
- 虚拟角色(virtual characters)
- 机器人(robotics)
- 具身智能体仿真(embodied-agent simulation)
这些场景的共同需求是「长时序、可干预、物理可信」的动态环境,恰好对应世界模型研究的核心议题。
信息边界
需要指出的是,此次 Runway 仅通过 X 帖文进行了研究预告,公开信息中未包含论文、benchmark、技术架构细节或可体验入口,更多资料指向官方提供的外部链接。GWM Worlds 2 当前仍处于研究分享阶段,距离正式产品化或开源发布尚有距离,其实际效果与可用性有待后续公开材料进一步验证。
