Nemotron 3.5 Lightning 登陆 SageMaker JumpStart
NVIDIA 开源模型 Nemotron 3.5 Lightning 现已在 Amazon SageMaker Jump…
NVIDIA 与 Nemotron 联盟联合开发的开放权重大模型 Nemotron 3.5 Lightning 现已在 Amazon SageMaker JumpStart 提供部署,用户无需自行配置推理基础设施即可上线该模型。这是 NVIDIA 一款面向高吞吐量智能体(agentic)工作负载设计的专用轻量化模型,强调高频调用下的速度与可控成本。
模型架构与核心规格
Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数量 300 亿,每次前向传播仅激活 30 亿参数,因此可在单颗受支持的 GPU 上运行。该模型由 NVIDIA 与 Nemotron 联盟从前沿模型 Nemotron 3 Ultra 蒸馏而来,基于开放数据集训练,并以开放权重形式发布,企业可对其进行后训练并保留所得权重。
- 总参数量:30B;激活参数:3B
- 上下文窗口:最高 100 万 tokens
- 输入/输出:纯文本
- 推测解码:DFlash
- 吞吐量:高频智能体负载下最高可提升 4 倍
- 任务完成速度:高频智能体负载下最高加快 30%
- 衍生自:NVIDIA Nemotron 3 Ultra
NVIDIA 将其定位为「同类别中最快的开放模型」,专为长时间运行的智能体负载而优化。
面向智能体工作流的「系统化模型」策略
持续运行的智能体在多轮会话中需要不断采集上下文、观察环境、推理并执行动作,但并非每一步都要求前沿级别的模型能力。多阶段工作流的规划与子智能体编排通常依赖前沿推理,而告警分类、表单字段抽取、策略合规检查等相对简单却高频的任务,更适合由小而专的模型承担。
Nemotron 3.5 Lightning 正是为「系统化模型」路线中高频调用端设计:
- MoE 架构在长多轮会话中有助于维持高吞吐
- DFlash 推测解码可进一步降低单 token 延迟
- 100 万 token 上下文窗口支持智能体在长会话中保留累积状态,避免反复重新对接
- 与 NVIDIA NeMo Switchyard 协同时,可按工作流步骤在模型池间路由,按需选取最适合的模型
推理与智能体基准成绩
NVIDIA 在统一测试框架下公布了 BF16 与 NVFP4 两种精度在多项目基准上的成绩:
- MMLU Pro:BF16 81.94,NVFP4 81.62
- GPQA Diamond:BF16 75.44,NVFP4 75.57
- SWE-bench Verified:BF16 51.56,NVFP4 52.80
- PinchBench:BF16 85.37,NVFP4 83.43
- IFBench:BF16 71.88,NVFP4 72.88
- AA-LCR:BF16 52.00,NVFP4 49.19
NVIDIA 同时表示,相关评测脚本与命令已在 NeMo Gym 公开,便于在统一条件下复现。需要注意的是,第三方供应商自报成绩与本测试结果可能存在差异。整体来看,NVFP4 量化在多数任务上与 BF16 接近,仅在 AA-LCR 等少量任务上出现一定回落。
典型企业场景
官方罗列了几类高频、专业化的智能体应用方向:
- 个人助理:长时间运行的邮件、日历、项目与行程管理助手
- 金融服务:文档抽取、规则核验、风险监测与结构化摘要
- 安全运营:告警丰富、事件分类、日志查询、控制项校验与指标关联
- 电信:网络告警分诊、网络配置优化、计费咨询应答
- 零售:商品目录补全、库存与履约异常处置、产品发现辅助,以及订单、退换货与会员咨询
这些场景的共同特征是模型调用频次高、动作相对专用,对单次延迟与吞吐极为敏感。
在 SageMaker JumpStart 上部署
部署前需准备的先决条件包括:拥有 AWS 账户、具备 SageMaker JumpStart 的相应权限,以及足够的 GPU 实例服务配额,例如 ml.g6e.12xlarge、ml.p4d.24xlarge 或 ml.p5.48xlarge。模型部署后会创建一个 SageMaker AI 端点,运行期间持续产生费用,使用完毕后应删除以免持续计费。
部署步骤简述:
- 打开 Amazon SageMaker Studio
- 在导航面板中选择 SageMaker JumpStart
- 搜索 Nemotron 3.5 Lightning 并选择模型
- 按指引选择实例类型并完成部署
需要说明的是,本次上线的 SageMaker JumpStart 模型卡片暂未开放 JumpStart 自定义能力;如需针对特定领域进行后训练,可通过 NVIDIA NeMo 完成后再部署到目标环境,从而把定制后的模型引入企业既有工作流。
