英伟达开源 Nemotron 3.5 Lightning,主打高频智能体任务
英伟达发布 300 亿参数开源 MoE 模型及配套路由库,主攻智能体高频任务,强调速度与成本效率,并透露更大规模的 Ne…
美国当地时间 8 月 11 日,英伟达正式发布开源模型 Nemotron 3.5 Lightning,同时推出开源模型路由库 NeMo Switchyard。这是英伟达 CEO 黄仁勋 7 月底公开表态支持开源后,公司在开源方向上落地的首批实质性动作。开发者可在 Hugging Face 等平台免费下载 Nemotron 3.5 Lightning,并可根据需求自行部署、修改和二次开发,无需额外申请授权,也不收取模型许可费。
面向高频智能体任务的 300 亿参数模型
Nemotron 3.5 Lightning 是一款 300 亿参数的混合专家(MoE)模型,主要面向长期运行的智能体系统,承担代码审查、工具调用、安全告警监控、账单问答等高频任务。在复杂的智能体工作流中,更强的推理模型可以负责任务规划,而 Nemotron 3.5 Lightning 则负责大量重复性的执行型工作,从而减少对大模型的调用次数、压低运行成本。
英伟达官方数据显示:
- 输出速度最高可达同类模型的 4 倍
- 智能体任务完成速度提高约 30%
- 在内部自研的智能体评测基准 PinchBench 上,匹配 Qwen 3.6-35B 准确率的同时,任务完成速度快约 30%
不过从通用能力看,Nemotron 3.5 Lightning 并非当前最强模型。第三方测评机构 Artificial Analysis 的 Intelligence Index 显示,该模型在 9 项评估中得分 24,与 gpt-oss-120b 持平,低于部分更大的模型。其定位明确是「高频任务专用」,而非通用前沿模型。
部署与企业落地
Nemotron 3.5 Lightning 支持多种部署形态,覆盖英伟达 RTX PC、DGX Spark、DGX Station、Jetson,也可扩展到 RTX PRO 工作站、数据中心和云端。
目前已有不少企业在真实业务中测试或部署该模型:
- Crowd Strike:用于网络安全
- Harvey、Trajectory:用于法律服务
- CodeRabbit、Baseten:用于代码审查
- LilaSciences:用于物理和生命科学任务
- FastinoLabs:针对软件开发、金融和医疗保健定制
英伟达还公布了 CodeRabbit 的训练案例:使用标准 NeMo Auto 模型配方训练一个周期,约两个小时、85 美元,即可构建出可工作的路由器智能体。同时,英伟达在许可允许范围内发布了训练数据和技术细节,并推出 Nemotron-RL-Agentic-Terminal-Pivot 数据集,用于进一步训练编码智能体。
NeMo Switchyard:模型之间的「调度员」
当企业同时拥有多个模型时,如何选模型成为新问题。复杂任务需要更强的推理能力,简单任务更看重速度和成本;全部使用大模型成本过高,全部使用小模型又可能影响效果。NeMo Switchyard 正是为这一场景设计的开源模型路由库。
它可以根据任务需求,在不同模型之间动态选择。开发者可按准确率、延迟和成本设置路由策略,也可以按业务需要自定义路由逻辑。据英伟达企业生成式 AI 软件副总裁 Kari Briski 介绍,Switchyard 在任务启动前不会预先指定由哪个模型处理哪类任务,而是基于智能体的当前状态动态选择,并将 Token 成本纳入考量。
英伟达公布的部分企业测试结果如下:
- LangChain:在 145 个多轮 DeepAgents 任务中,仅将 7% 的调用交给前沿模型,准确率下降 6% 的情况下,成本下降 74%
- Ramp:在 RampSWE-Bench 中取得与前沿模型相当的性能,成本降低 58%,运行时间减少 33%
- Cognition:在 DevinDesktop 中集成 Switchyard,平均成本比全部使用单一前沿模型低 28%
- Boomi:在 5 项路由能力测试中实现 100% 的领域路由准确率,将 59% 的流量分发给速度快 5 倍的微调模型,后续轮次延迟降低 21%
Nemotron 4 与英伟达的开源战略
在 300 亿参数模型和路由工具之外,英伟达还在推进更大的 Nemotron 4 开源项目。据 The Information 援引参与该项目的员工消息,最大的 Nemotron 4 模型预计至少拥有 1 万亿参数,约为目前英伟达最大模型 Nemotron 3 Ultra 的两倍。不过该项目仍处开发阶段,具体规格和发布日期尚未确定,大规模训练预计需要数月时间。
从整体布局看,英伟达关注的并不只是单个模型,而是包含模型、训练数据、评测工具、开发框架和计算资源的完整体系。围绕 Nemotron 项目,Reflection、Cursor、Thinking Machines、Mistral 等公司参与了训练数据、评估支持与模型设计,Prime Intellect 则贡献了大量用于训练能力提升的模拟环境。截至今年 4 月,英伟达的多年期云服务承诺规模已扩大至 280 亿美元,覆盖至 2031 年初,为下一阶段 AI 竞争提前储备基础设施。
与 OpenAI、Anthropic 等公司围绕「打造最强模型」的竞争路径不同,英伟达更希望成为连接模型、工具、计算与开发者生态的平台,从芯片供应商转向 AI 基础设施提供方。推动开源的意义,也不只是让 Nemotron 取代商业模型,而是让更多企业能够获取、修改和部署 AI 模型,从而拉高训练、推理和部署对芯片与算力的需求——这或许是英伟达更深一层的算盘。
