英伟达发布Nemotron 3.5 Lightning开源模型 智能体执行层迎来高性价比利器

打开网易新闻 查看精彩图片

英伟达于8月11日正式发布Nemotron 3.5 Lightning开源模型,采用300亿参数混合专家架构,每次推理仅激活约30亿参数,输出速度较同级别开源模型提升最高达4倍,智能体任务完成速度提升约30%。同时发布的NeMo Switchyard路由库可将智能体工作流每一步调度至最合适的模型,实测成本压缩至单独运行Opus 4.8的三分之一。这一组产品标志着英伟达从硬件供应商向全栈AI生态服务商的战略转型正在实质性推进。

技术架构与核心能力

Nemotron 3.5 Lightning采用混合专家架构,在保持总参数300亿的同时每次推理仅激活约30亿参数,使模型在资源占用与推理效率之间找到新的平衡点。该模型可直接部署在单块RTX显卡的PC上,也可扩展至DGX Spark、Jetson边缘设备及数据中心集群,覆盖从消费端到企业端的完整算力谱系。

在PinchBench基准测试中,Nemotron 3.5 Lightning获得86分,与OpenAI的gpt-oss-120b相当,仅落后于规模为其四倍的Nemotron 3 Super模型2分。英伟达强调该模型的核心价值不在于绝对性能排位,而在于其在智能体工作流中的执行效率。企业AI系统通常由前沿模型负责复杂规划,Nemotron 3.5 Lightning则承担代码审查、安全监控、数据处理等高频执行任务,这类任务对速度和成本敏感度远高于对绝对推理深度的要求。

行业影响与生态布局

打开网易新闻 查看精彩图片

当前企业AI应用正从单模型对话模式向多智能体协作模式演进。NeMo Switchyard允许开发者定义模型池和路由策略,将每个工作流步骤交由最适合的模型处理。内部基准测试显示,采用Switchyard路由的系统在维持前沿级任务完成度的同时,可将成本压缩至单独运行Opus 4.8的约三分之一。

多家企业已在实际场景中验证该方案的有效性。LangChain在145个多轮Deep Agents任务中通过仅7%的调用量路由至前沿模型,实现了74%的成本下降;Ramp在内部SWE-Bench基准测试中匹配了前沿模型性能,同时降低58%成本和33%运行时间。CrowdStrike正针对网络安全工作流对该模型进行微调,Harvey与Trajectory合作用于法律领域,CodeRabbit用于代码审查。

从竞争格局来看,Nemotron 3.5 Lightning的发布加剧了开源模型市场的技术迭代速度。中国大模型厂商近期密集推出资深开源方案,DeepSeek-Kimi K3和Qwen3.8-Max分别以2.8万亿和2.4万亿参数进入大参数时代,开源模型授权条款趋于收紧,行业正从价格竞争转向智能竞争。英伟达选择在此节点推出高性价比执行层开源模型,意在填补多智能体系统中执行型模型的市场空白。

落地应用与未来展望

对于企业用户,Nemotron 3.5 Lightning的落地路径相对清晰。首先需要明确智能体工作流的分解方式,将任务划分为规划层和执行层。其次,企业可通过NeMo进行二次微调,将自有业务数据注入模型。最后,借助NeMo Switchyard的路由能力,企业可在多模型之间动态分配负载。

展望未来,Nemotron 3.5 Lightning的迭代方向将聚焦于三个维度:一是进一步提升推理速度,通过架构优化和量化技术降低单次token计算成本;二是扩展多模态执行能力,使其不仅能处理文本和代码,还能理解结构化数据表格;三是深化与主流推理框架的集成,目前已获得vLLM、Ollama、llama.cpp和LM Studio的当天支持。随着智能体成为企业应用的标配,执行层模型的市场空间正在快速打开。

【信源】钛媒体 | 从卖芯片到卖整个AI工作流:英伟达发布Nemotron 3.5与模型路由器 | 2026-08-12

【信源】每经网 | 英伟达据悉开发万亿参数开源AI模型Nemotron 4 | 2026-08-12

【信源】The New Stack | Nvidia launches a smaller, faster Nemotron model and a router to put it to work | 2026-08-11

【信源】NVIDIA官方 | Nemotron 3.5 Lightning for Fast, Specialized Agentic Tasks | 2026-08-11