NVIDIA 如何打造 AI 时代的开放模型版图
基于与 NVIDIA 应用深度学习研究副总裁的对话,梳理 Nemotron、Cosmos、GR00T 等开放模型矩阵及其…
NVIDIA 早已不只是 GPU 厂商,它还是当前全球最大的开放 AI 模型发布者之一——其模型在 Hugging Face 上的下载量长期名列前茅,覆盖范围远超聊天机器人:推理、世界模型、人形机器人、自动驾驶,乃至药物发现、量子计算与全球预报。本文基于与 NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 的对话,系统梳理这支开放模型矩阵的脉络与背后的方法论。
两条主线:符号世界与物理世界
NVIDIA 的开放模型沿着两个方向展开。一端是处理符号世界的模型——语言、代码与推理;另一端是面向物理世界的模型,服务于机器人和自动驾驶汽车的感知与行动。多数产品都分布在这条光谱的不同位置。
按用途划分,其开放模型家族主要包括:
- 推理模型:Nemotron
- 世界模型:Cosmos
- 人形机器人基础模型:Isaac GR00T
- 自动驾驶模型:Alpamayo
- 生物医药模型:BioNeMo
Nemotron:从大语言模型到推理主力
推理模型会在给出最终答案前先生成中间 token,从而能"思考"数学、编程等需要多步推导的任务。当下大多数前沿模型都属于此类。
Nemotron 系列的关键节点:
- 2023 年:第一代 Nemotron 发布
- 2024 年:340B 参数的下一代上线
- 2025 年:推出更快的混合架构版本
- 2025 年末至 2026 年:Nemotron 3 分三档发布
- Nano:面向简单任务,主打速度
- Super:用于更复杂的规划与推理
- Ultra:承载最重度的推理负载
Cosmos:物理 AI 的「ChatGPT 时刻」
语言模型擅长预测下一个 token,却无法理解衬衫袖子如何折叠、水杯倾倒瞬间的样子。世界模型填补了这一空白:给定当前世界状态与动作,预测下一帧状态,并生成物理上合理的视频。这一能力对于慢、贵或危险的现实场景中的训练数据生成尤其重要。
NVIDIA CEO 黄仁勋称之为"物理 AI 的 ChatGPT 时刻"。Cosmos 的演进路径:
- 2025 年 1 月 CES:首发
- 2026 年:统一为全能模型 Cosmos 3,可同时生成场景、推理并预测下一步
- 同步推出「世界动作模型」,将预训练视频骨干直接转化为机器人策略
- 4B 参数的 Edge 版本可部署在机器人本体上实时控制
从世界模型到动作:GR00T 与 Alpamayo
世界模型能预测下一帧画面,但机器人必须真正"动起来"——把摄像头画面实时转化为电机动作,且要应对没有预设脚本的任务。视觉-语言-动作(VLA)模型正是为此设计:输入图像与指令,输出运动指令。
NVIDIA 的相关布局:
- Isaac GR00T:人形机器人基础模型
- 2024 年项目立项
- 2025 年初发布首个开源版本 GR00T N1
- 当前迭代至 GR00T 1.7,以 Cosmos 为推理骨干,融合感知、推理与「运动中操作」(locomanipotion)能力;1.7 版本附带商用许可,便于实际部署
- Alpamayo:面向推理式自动驾驶的开放模型家族
- 同样以 Cosmos 为推理骨干,可处理训练数据未覆盖的路面场景
- 向开发者开放每一步决策背后的因果链路
为什么硬件公司要把模型免费开源
一个常见疑问是:为何一家卖 GPU 的公司要把模型免费开源?答案与 GPU 业务紧密相连——这些模型恰好跑在 NVIDIA 自家硬件上。开放生态放大了开发者对 NVIDIA 平台的需求,同时推动整个 AI 行业围绕其技术栈进行标准化。
Catanzaro 在访谈中分享的团队经验可以归结为几条:
- 真正的开放不仅指权重,还包括训练数据——后者对可复现性同样关键
- 统一的底层基础架构让小团队能高效产出多个领域的模型
- 把模型发布到 Hugging Face 等开放平台,能快速获取真实使用反馈
从语言到物理,从权重到数据,NVIDIA 正用一套连贯的开放策略,把自身从「芯片供应商」扩展为「AI 基础设施提供者」。
