桃子桃子快讯
返回首页
产品功能

Nemotron 3.5 Lightning 登陆 SageMaker JumpStart

NVIDIA 开源模型 Nemotron 3.5 Lightning 现已在 Amazon SageMaker Jump…

2026.08.18 · 周二5 分钟阅读

NVIDIA 与 Nemotron 联盟联合开发的开放权重大模型 Nemotron 3.5 Lightning 现已在 Amazon SageMaker JumpStart 提供部署,用户无需自行配置推理基础设施即可上线该模型。这是 NVIDIA 一款面向高吞吐量智能体(agentic)工作负载设计的专用轻量化模型,强调高频调用下的速度与可控成本。

模型架构与核心规格

Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数量 300 亿,每次前向传播仅激活 30 亿参数,因此可在单颗受支持的 GPU 上运行。该模型由 NVIDIA 与 Nemotron 联盟从前沿模型 Nemotron 3 Ultra 蒸馏而来,基于开放数据集训练,并以开放权重形式发布,企业可对其进行后训练并保留所得权重。

  • 总参数量:30B;激活参数:3B
  • 上下文窗口:最高 100 万 tokens
  • 输入/输出:纯文本
  • 推测解码:DFlash
  • 吞吐量:高频智能体负载下最高可提升 4 倍
  • 任务完成速度:高频智能体负载下最高加快 30%
  • 衍生自:NVIDIA Nemotron 3 Ultra

NVIDIA 将其定位为「同类别中最快的开放模型」,专为长时间运行的智能体负载而优化。

面向智能体工作流的「系统化模型」策略

持续运行的智能体在多轮会话中需要不断采集上下文、观察环境、推理并执行动作,但并非每一步都要求前沿级别的模型能力。多阶段工作流的规划与子智能体编排通常依赖前沿推理,而告警分类、表单字段抽取、策略合规检查等相对简单却高频的任务,更适合由小而专的模型承担。

Nemotron 3.5 Lightning 正是为「系统化模型」路线中高频调用端设计:

  • MoE 架构在长多轮会话中有助于维持高吞吐
  • DFlash 推测解码可进一步降低单 token 延迟
  • 100 万 token 上下文窗口支持智能体在长会话中保留累积状态,避免反复重新对接
  • 与 NVIDIA NeMo Switchyard 协同时,可按工作流步骤在模型池间路由,按需选取最适合的模型

推理与智能体基准成绩

NVIDIA 在统一测试框架下公布了 BF16 与 NVFP4 两种精度在多项目基准上的成绩:

  • MMLU Pro:BF16 81.94,NVFP4 81.62
  • GPQA Diamond:BF16 75.44,NVFP4 75.57
  • SWE-bench Verified:BF16 51.56,NVFP4 52.80
  • PinchBench:BF16 85.37,NVFP4 83.43
  • IFBench:BF16 71.88,NVFP4 72.88
  • AA-LCR:BF16 52.00,NVFP4 49.19

NVIDIA 同时表示,相关评测脚本与命令已在 NeMo Gym 公开,便于在统一条件下复现。需要注意的是,第三方供应商自报成绩与本测试结果可能存在差异。整体来看,NVFP4 量化在多数任务上与 BF16 接近,仅在 AA-LCR 等少量任务上出现一定回落。

典型企业场景

官方罗列了几类高频、专业化的智能体应用方向:

  • 个人助理:长时间运行的邮件、日历、项目与行程管理助手
  • 金融服务:文档抽取、规则核验、风险监测与结构化摘要
  • 安全运营:告警丰富、事件分类、日志查询、控制项校验与指标关联
  • 电信:网络告警分诊、网络配置优化、计费咨询应答
  • 零售:商品目录补全、库存与履约异常处置、产品发现辅助,以及订单、退换货与会员咨询

这些场景的共同特征是模型调用频次高、动作相对专用,对单次延迟与吞吐极为敏感。

在 SageMaker JumpStart 上部署

部署前需准备的先决条件包括:拥有 AWS 账户、具备 SageMaker JumpStart 的相应权限,以及足够的 GPU 实例服务配额,例如 ml.g6e.12xlarge、ml.p4d.24xlarge 或 ml.p5.48xlarge。模型部署后会创建一个 SageMaker AI 端点,运行期间持续产生费用,使用完毕后应删除以免持续计费。

部署步骤简述:

  1. 打开 Amazon SageMaker Studio
  2. 在导航面板中选择 SageMaker JumpStart
  3. 搜索 Nemotron 3.5 Lightning 并选择模型
  4. 按指引选择实例类型并完成部署

需要说明的是,本次上线的 SageMaker JumpStart 模型卡片暂未开放 JumpStart 自定义能力;如需针对特定领域进行后训练,可通过 NVIDIA NeMo 完成后再部署到目标环境,从而把定制后的模型引入企业既有工作流。

信源