智东西8月12日消息,昨日,英伟达发布开源大语言模型Nemotron 3.5 Lightning,以及面向Agent的开源智能路由库NeMo Switchyard。前者总参数量为300亿,推理时仅激活约30亿参数,输出速度最高达到同等规模模型的4倍;后者可以在多款模型之间自动分配任务,英伟达内部测试显示,其任务完成成本可降至全部使用Claude Opus 4.8时的1/3。
▲Nemotron 3.5 Lightning和NeMo Switchyard开源(图源:Hugging Face、Github)
Nemotron 3.5 Lightning是英伟达7月24日签署支持开源AI模型的联名公开信后,首次推出的开源模型。
英伟达创始人兼CEO黄仁勋称,Nemotron 3.5 Lightning适用于持续运行和长时间工作的Agent,并将其概括为“智能、快速、高效且开源”。
▲黄仁勋转发Nemotron 3.5 Lightning发布消息(图源:X)
大模型测评机构Artificial Analysis对总参数量低于400亿的开放权重模型进行了比较。Nemotron 3.5 Lightning综合能力得分为24分,输出速度约为670 token/s,是图中唯一进入高速度、高得分区域的模型。
▲Nemotron 3.5 Lightning在Artificial Analysis的评测结果(图源:X)
英伟达称,Nemotron 3.5 Lightning主要承担Agent执行长程任务时的工具调用、结果检查、格式整理和代码操作等高频工作。在技术上,Nemotron 3.5 Lightning结合多token预测、推测解码和低精度量化等技术提高推理效率。
为了进一步降低整个Agent工作流的运行成本,英伟达还推出NeMo Switchyard路由库,对不同模型进行统一调度。
据技术博客称,NeMo Switchyard会路由库根据任务难度、模型能力、成本和延迟选择模型,将复杂规划交给能力更强的前沿模型,把工具调用、结果检查和格式整理等高频操作交给速度更快、成本更低的模型。在LangChain完成的145项多轮Agent任务测试中,Switchyard仅将7%的请求交给前沿模型,整体成本降低74%
此外,据外媒The Information昨日报道,英伟达正在研发更大规模的Nemotron 4系列,其最大版本预计至少拥有1万亿参数,目标是达到全球领先开源模型的水平。不过,该模型尚未完成最终训练,具体规格及发布时间均未确定。
目前,Nemotron 3.5 Lightning已全面开放至Hugging Face、ModelScope、OpenRouter以及英伟达官方开发者平台,供开发者下载与调用,NeMo Switchyard也已在GitHub开源。
Nemotron 3.5 Lightning开源链接:
https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
NeMo Switchyard开源链接:
https://github.com/NVIDIA-NeMo/Switchyard
一、300亿参数每次激活30亿,1万项Agent任务完成速度比Qwen 3.6快30%
Nemotron 3.5 Lightning采用混合专家架构。该模型包含300亿参数,但处理每个token时,路由器只会调用少量专家模块,因此每次推理激活约30亿参数。这种设计使模型在保留300亿参数总体容量的同时,减少每次推理实际参与计算的参数量,从而降低计算开销。
英伟达将Nemotron 3.5 Lightning定位为Agent执行长程任务中的工作模型,主要负责工具调用、检查工具返回结果、整理输出格式和运行代码命令等高频操作。
在这套模型分工中,Nemotron 3 Ultra等前沿推理模型负责复杂规划和任务编排,Nemotron 3.5 Lightning则执行数量更多、流程相对固定的具体任务。英伟达认为,如果每一步都调用前沿模型,会增加成本和延迟。
Artificial Analysis测试显示,Nemotron 3.5 Lightning处于同类开源模型的能力—速度“帕累托前沿”,即目前没有其他参测模型能在综合能力和输出速度两项指标上同时超过它。
▲Nemotron 3.5 Lightning在准确率与输出速度方面的表现(图源:英伟达)
在更关注Agent实际任务完成效率的PinchBench测试中,Nemotron 3.5 Lightning以86%的准确率完成1万项任务。在准确率相近的情况下,其任务完成速度比Qwen 3.6 35B快30%。
▲Nemotron 3.5 Lightning与同类模型的Agent任务完成效率对比(图源:英伟达)
英伟达称,该模型的输出速度最高可达到同等规模模型的4倍。不过,这一数据主要反映特定部署环境下的生成速度,并不代表Nemotron 3.5 Lightning在综合智能方面超过所有同规模模型。
目前,网络安全厂商CrowdStrike、法务AI平台Harvey、代码审查工具商CodeRabbit正分别探索将该模型用于网络安全、法律服务和代码审查;科研平台Lila Sciences参与提升其物理及生命科学任务的推理能力,垂直微调服务商Fastino Labs则针对软件开发、金融和医疗场景进行了定制。
▲多家企业针对专业任务定制Nemotron 3.5 Lightning(图源:英伟达)
技术方面,Nemotron 3.5 Lightning在训练中加入多token预测能力,可以提前预测后续多个token,再对预测结果进行验证。英伟达还为其提供DSpark和DFlash两款草稿模型,用于快速生成待验证内容,以进一步提高推测解码速度。
该模型同时提供BF16和NVFP4版本,可运行在Jetson、GeForce RTX 5090和DGX Spark等本地设备上,也能部署至工作站、数据中心及云环境。
Nemotron 3.5 Lightning现已上线Hugging Face、ModelScope、OpenRouter和英伟达开发平台。英伟达还开源了用于强化模型编程Agent能力的数据集Nemotron-RL Agentic Terminal Pivot。
二、Agent任务按难度分配模型,合作伙伴实测成本最高降低74%
英伟达称,Agent执行长程任务时,通常要经历规划、检索、工具调用、结果验证和纠错等多个环节,而不同环节对模型能力、响应速度和运行成本的要求并不相同。
NeMo Switchyard因此会结合请求内容、上下文、模型能力、运行成本和延迟,为Agent工作流中的不同环节选择模型。例如,复杂规划可以交给能力更强的前沿模型,工具调用和结果整理等常规步骤则可以转交给速度更快、成本更低的模型。
该工具并不局限于英伟达自己的模型,可以同时接入开源和闭源模型。开发者还可以根据准确率、速度和成本等目标调整路由策略。
NeMo Switchyard提供多种路由方式。其中,分类路由器根据任务所属领域选择模型;阶段路由器结合Agent当前执行阶段及工具使用情况调整模型;升级路由器则先调用成本较低的模型。如果当前模型无法可靠完成任务,NeMo Switchyard再交给能力更强的模型。
▲NeMo Switchyard系统架构图(图源:英伟达)
英伟达内部测试显示,与所有任务都使用Claude Opus 4.8相比,NeMo Switchyard可以在保持接近Claude Opus 4.8准确率的情况下,将任务完成成本降至约三分之一。
▲英伟达内部测试(图源:英伟达)
在合作伙伴测试中,AI Agent开发基础设施厂商LangChain在145项多轮Agent任务中进行了测试。Switchyard仅将7%的请求发送给Claude Opus 4.8,虽然准确率下降约6个百分点,但总体成本降低74%。
▲NeMo Switchyard在LangChain测试中的表现(图源:LangChain)
软件研发Agent厂商Cognition将阶段路由方法用于Devin Desktop后,平均成本比全部请求使用同一前沿模型降低28%。
金融与软件工程AI服务商Ramp Labs在自研软件工程评测基准Ramp SWE-Bench中完成英伟达 NeMo Switchyard调度工具实测,并称,其测试成本降低58%,运行时间缩短33%。
▲NeMo Switchyard在合作伙伴测试中的成本与运行效率表现(图源:X)
英伟达还在与企业级AI网关服务商KongKong、开源多模型统一网关厂商LiteLLM、开源大模型与智能体研发机构Nous Research和西门子等企业合作,将路由能力接入AI网关、开发工具和企业Agent。
三、被曝研发万亿参数模型,目标之一是扩大GPU需求
据The Information昨日报道,Nemotron 3.5 Lightning只是英伟达扩大开源模型投入的一部分。该公司正在开发Nemotron 4系列,希望其性能达到全球领先开源模型的水平。
多名员工预计,Nemotron 4最大版本可能拥有至少1万亿参数,规模约为Nemotron 3 Ultra的两倍。英伟达已经确定了部分训练数据和架构方案,但尚未完成最终训练,发布时间也没有敲定。
英伟达扩大模型投入,一方面可以用模型开发反向优化芯片和软件,另一方面也希望降低企业使用AI的门槛,从而扩大GPU需求。高质量开源模型越多,能够训练、微调和部署AI的企业就越多,英伟达硬件的潜在客户范围也会随之扩大。
不过,这也让英伟达与客户和投资对象之间的关系变得更加复杂。OpenAI和Anthropic等前沿实验室是英伟达芯片的重要客户,Reflection AI、Thinking Machines Lab等开源模型公司则获得过英伟达投资。英伟达亲自开发高性能模型,可能与这些企业形成直接竞争。
结语:英伟达补齐Agent模型调度环节
Nemotron 3.5 Lightning与NeMo Switchyard分别切入Agent的执行和调度环节:前者承担调用频繁、强调速度的具体任务,后者根据任务难度、模型能力、成本和延迟,在多款开源及闭源模型之间分配请求。这套方案的重点不是依赖一款模型完成全部工作,而是通过多模型协作控制长程Agent的运行成本。
随着Agent从一次性问答转向持续执行搜索、编程和企业流程等任务,模型调用量及推理成本随之增加。模型路由由此成为新的基础设施环节,云厂商、模型平台和Agent开发工具都在尝试将不同模型接入同一套工作流,竞争重点也从单一模型能力延伸至任务分配效率和整体成本。
英伟达此次同时布局执行模型、模型路由和被曝在研的万亿参数模型,正在将业务从GPU进一步延伸至Agent技术栈。若开源模型和多模型协作得到更广泛采用,新增的训练、微调和推理需求也可能继续带动其计算平台的使用。
来源:英伟达、The Information
热门跟贴