桃子桃子快讯
返回首页
模型发布

英伟达发布 Nemotron 3 Ultra 开源大模型:550B 参数,推理吞吐量领先开源竞品

英伟达推出 Nemotron 3 Ultra,550B 总参数 / 55B 激活参数,采用 Mamba-Attentio…

2026.07.24 · 周五4 分钟阅读

英伟达于 2026 年 6 月 4 日正式发布 Nemotron 3 Ultra,并同步开源预训练、后训练与量化权重。这是 Nemotron 3 家族的最终旗舰版本,总参数 550B、激活参数 55B,采用混合 Mamba-Attention 的 Mixture-of-Experts 架构,官方定位为该系列「能力最强」的模型。

核心架构与技术特性

Nemotron 3 Ultra 采用多项前沿设计:

  • 基于 Mixture-of-Experts Hybrid Mamba-Attention 架构,并引入 LatentMoE 提升精度。
  • 集成 MTP 层,支持原生 speculative decoding,加快推理速度。
  • 支持推理阶段的 reasoning budget control,可对推理算力进行调控。
  • 预训练采用 NVFP4 低精度格式,降低显存与算力消耗。
  • 后训练阶段在 SFT(监督微调)与 RL(强化学习)之外,额外引入 Multi-teacher On-Policy Distillation (MOPD),进一步提升模型准确性。

性能与基准表现

英伟达以一组吞吐量与精度数据展示 Nemotron 3 Ultra 的竞争力:

  • 在 8k token 输入 / 64k token 输出设置下,推理吞吐量分别达到 GLM-5.1-754B-A40B 的 5.9 倍Kimi-K2.6-1T-A32B 的 4.8 倍Qwen-3.5-397B-17B 的 1.6 倍
  • 在多项基准上与主流开源大模型 精度持平,整体处于开源第一梯队。
  • 支持最长 1M token 上下文,并在 RULER 1M 上下文评测中优于其他开源 SOTA 模型。

开源内容与生态

本次发布一次性放出了从基座到 RLHF 奖励模型的完整权重与配套数据集:

  • 模型权重:Nemotron 3 Ultra 550B-A55B NVFP4(后训练 + NVFP4 量化)、BF16 后训练版、Base BF16 基座版,以及用于 RLHF 的 GenRM 模型。
  • 数据集
    • Nemotron-Pretraining-Code-v3:截至 2025 年 9 月 30 日来自 GitHub 的 173B 新鲜代码 token。
    • Nemotron-Pretraining-Legal-v1:用于提升法律能力的合成数据集。
    • Nemotron-Pretraining-Specialized-v1.2:聚焦事实记忆、伦理场景与多种生成/选择题的合成数据。
    • Nemotron-Posttraining-v3:覆盖智能体、推理与通用能力的后训练数据集,用于 SFT 与 RL 阶段。
  • 模型配方:同步在 NVIDIA Nemotron 开发者仓库公开训练与推理流程。

意义与定位

Nemotron 3 Ultra 的发布让英伟达在开源权重赛道形成完整布局,从数据、基座、后训练到推理优化(NVFP4、MTP、LatentMoE)全链路开放。对于希望在本地部署大规模 MoE 模型、并关注长上下文与推理效率的开发者而言,550B-A55B 是一个新的标杆级选项。官方 Tech Report 已同步上线,更细粒度的技术细节可前往查阅。

信源