NVIDIA Nemotron 3.5 Lightning 开源:30B MoE 架构、百万级上下文
Together AI 上线 NVIDIA Nemotron 3.5 Lightning 开源模型,30B 总参数 /…
Together AI 在 X 平台宣布,已上线 NVIDIA Nemotron 3.5 Lightning 开源大模型,定位为同级别中速度最快的开放权重模型。该模型面向开发者提供推理服务,并支持后续微调与定制化部署。
核心规格
Nemotron 3.5 Lightning 采用 30B 总参数、3B 激活参数的混合 MoE(混合专家)架构,即每次推理仅激活约 3B 参数,其余参数按需调用,以兼顾性能与效率。模型支持 1M(100 万)token 上下文窗口,并引入 DFlash 推测解码(speculative decoding)以加速推理过程,适合长文档摘要、代码理解与多轮对话等场景。
性能表现
据 Together AI 披露,该模型在同档位开源模型中具备以下优势:
- 被称为同级别中最快的开源模型
- 吞吐量最高提升至 4 倍
- 任务完成速度最高提升 30%
上述数据来源于 Together AI 自有评测口径,尚未与 NVIDIA 官方 benchmark 或第三方独立评测完整对齐,开发者选型时建议结合自身业务场景进行实测。
可用性与开源策略
模型以开放权重(open weight)形式发布,开发者既可以在 Together AI 平台直接调用推理接口,也可以下载权重进行后训练(post-training)与定制化开发。这意味着 Nemotron 3.5 Lightning 不仅适合直接推理部署,也可作为下游应用的基础模型进行微调与领域适配。
行业定位
NVIDIA Nemotron 系列长期被视为面向企业的开放模型路线之一,持续在长上下文与推理效率两端发力。Nemotron 3.5 Lightning 延续了「小激活、大总量」的 MoE 技术路径,与近期多款主流开源权重模型(如 DeepSeek、Qwen 系列)在架构选择上形成呼应,为企业在自托管推理场景中提供了新的候选。
