桃子桃子快讯
返回首页
开源

NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,专为边缘机器人打造

NVIDIA 在 Hugging Face 开源 4B 参数世界模型 Cosmos 3 Edge,支持机器人理解场景、实…

2026.07.20 · 周一4 分钟阅读

NVIDIA 于 Hugging Face 的 Cosmos 3 仓库正式开源 Cosmos 3 Edge,这是一款面向机器人与视觉 AI 智能体的 4B(40 亿)参数世界模型,定位是在内存受限的边缘设备上提供数据中心级性能,帮助物理 AI 系统理解周围环境、进行实时推理并直接生成机器人动作。

核心定位:边缘端的世界基础模型

Cosmos 3 Edge 设计目标明确——让工厂、仓库、医院等场景中的边缘机器具备场景理解与实时决策能力。模型已针对多款 NVIDIA 边缘硬件完成优化,包括 RTX PRO GPU、NVIDIA DGX、GeForce RTX GPU,以及最新发布的 Jetson T2000 和 T3000 模块。

作为后训练的世界动作模型(WAM),Cosmos 3 Edge 以 640×360 的机器人控制分辨率运行,在 Jetson Thor 上可实现每推理生成 32 个动作、15 Hz 的实时控制频率。在同尺寸(4B 参数)模型中,该模型在 VANTAGE-Bench 视觉分析榜单上排名第一,并在机器人策略学习任务上达到当前最优水平,覆盖智能基础设施与机器人方向。

双 Transformer 塔:自回归 + 扩散

Cosmos 3 的架构由两座 Transformer 塔组成,并通过共享多模态注意力层将二者统一在同一个表征空间中:

  • 自回归塔:处理视觉与文本 token,负责理解与推理;
  • 扩散塔:处理视觉、音频与动作 token,负责预测、生成与神经仿真。

两塔各自保留独立的归一化层与多层感知机(MLP),但在注意力层共享信息,从而使语言、视频、音频与动作在表征层面对齐。不同模态采用不同的注意力模式:语言使用因果注意力,扩散 token 则在更广的上下文上做注意力,以支持连贯的预测与生成。

统一动作表征:跨形态的物理智能

物理系统对「动作」的描述方式各异——车辆使用自车位姿与运动,相机使用相机运动,机械臂使用末端执行器位姿,而灵巧手还需要表示抓取状态。Cosmos 3 将这些不同本体映射到统一的动作表征上,把动作编码为紧凑的几何向量,包含平移、旋转、操作状态三类信息。

由此生成的视频不仅是视觉预测,更承载了动作与物理变化的因果关系——开发者可以直接获得与运动、控制、因果相关联的训练数据。

Policy 模式:从状态到动作与视觉结果

在 Policy 模式下,Cosmos 3 同时预测「应当执行的动作」与「执行后的预期视觉结果」,输入为当前状态,输出为动作与视觉后果。这种双向流让模型既能预测动作的效应,也能从观察到的效应反推动作,从而将因果建模与世界建模直接接入机器人策略训练与评估。

官方同时发布了基于 DROID 数据集后训练的 Cosmos 3 Edge Policy (DROID) 模型及配套后训练脚本,面向抓取-放置类任务。开发者可使用小型 H100 集群或 NVIDIA DGX Station 快速对 Cosmos 3 Edge 进行微调,再部署到 NVIDIA 边缘与加速计算平台。

配套资源与后续计划

除基础模型外,NVIDIA 同步放出了参考后训练 checkpoint 与训练配方,便于开发者针对自身应用场景进行适配与优化。完整模型与文档已在 Hugging Face 的 nvidia/Cosmos3-Edge 仓库开放下载。

信源