NVIDIA Cosmos-H-Dreams:手术机器人实时生成式仿真器
NVIDIA 将 Cosmos-H-Surgical-Simulator 蒸馏为可在单卡 RTX PRO 6000 上实…
NVIDIA 近日发布 Cosmos-H-Dreams,一个面向手术机器人的实时、可交互的生成式仿真系统。该框架将此前发布的 Cosmos-H-Surgical-Simulator 世界基础模型蒸馏为因果、少步扩散的学生模型,并通过 NVIDIA 自研的流式推理库 FlashDreams 提供服务。整套方案在单张 NVIDIA RTX PRO 6000 GPU 上即可运行,使研究人员或学到的策略能在闭环中控制仿真环境。
从世界模型到可交互仿真器
Cosmos-H-Surgical-Simulator 本身是建立在 Cosmos-Predict2.5-2B 之上的、以动作为条件的视频世界模型,基于 Open-H-Embodiment 数据集后训练得到。给定一帧手术场景画面和未来机器人轨迹,它能生成对应的视觉后果视频,用于离线策略评估与合成数据生成。
Cosmos-H-Dreams 在此基础上将该模型推向实时。其核心技术路径是:将多具身手术先验特化为面向 da Vinci Research Kit(dVRK)桌面缝合任务的模型,并通过自回归方式生成画面。运行时,模型接收一帧初始 RGB 图像与实时机器人运动学数据流,逐块产出后续帧。NVIDIA 还与 CMR Surgical 及 Cambridge Consultants 合作,在 Versius 手术控制平台上验证了实时集成。
蒸馏管线:教师—因果 Warmup—自强制蒸馏
为保留手术动力学细节,同时降低生成成本,Cosmos-H-Dreams 采用三阶段教师—学生训练管线。
- 教师模型:以 Cosmos-H-Surgical-Simulator 的 Open-H 权重为基础,采用统一 44 维动作表征;针对 dVRK 的双臂末端相对位移、旋转与夹爪状态进行映射。该教师在 JHU dVRK 桌面数据集上微调,训练样本除成功演示外,还包含针脱落、抛针失败、打结失败等异常与分布外片段,以确保仿真器能复现错误动作的后果。训练过程中,时间跨度从 12 帧逐步递增至 72 帧。
- 因果 Warmup:先预算并缓存教师去噪轨迹,再以该教师初始化一个因果学生模型,使其以因果注意力与流式 KV 缓存在教师缓存轨迹上学习,预先适应因果结构。
- 自强制蒸馏:为缓解自回归模型训练—部署不一致,学生在训练时即基于自身生成的历史向前滚动,并由冻结教师提供分布匹配监督,从而在生成误差累积之前就学会在自生成条件下保持稳定。
蒸馏后的学生模型支持少步扩散,每潜变量帧仅需约 2 步去噪,兼具教师级的手术先验与流式生成所需的因果结构。
FlashDreams:实时推理引擎
模型蒸馏只是实现实时的一半。Cosmos-H-Dreams 通过 FlashDreams 推理库对外服务,该库针对流式、自回归生成做了加速优化,使整条管线在单卡 RTX PRO 6000 上达到可交互的帧率,从而真正满足"边推边控"的闭环需求。
意义与下一步
Cosmos-H-Dreams 把"世界模型用于机器人仿真"从离线评估推进到实时交互层面,研究者可以在不接触真实手术器械的前提下,对视觉—语言—动作策略进行安全、可重复的测试与合成数据生成。NVIDIA 表示,下一步将围绕闭环物理 AI 展开,例如把仿真器与真实硬件反馈更紧密地结合,进一步覆盖从训练到部署的手术自主化链路。
