英伟达周二发布了Nemotron 3.5 Lightning,这是其Nemotron 3开源模型系列的最新成员。与此同时,该公司还推出了NeMo Switchyard——一个可用于驱动模型路由器的新开源库。
Nemotron 3.5 Lightning是一款拥有300亿参数的混合专家模型,由Nemotron联盟参与开发,其推理能力已接近参数量远更庞大的Nemotron 3 Super模型。不过,在Artificial Analysis的智能指数评测中,这两款英伟达模型的表现均落后于谷歌同等规模的Gemma 4 31B。
英伟达认为,这款模型的重点并不在于跑分,而在于速度和易于定制的能力。与同类小型模型的典型应用场景一致,其核心用法是由前沿大模型负责规划和统筹,由这款更小的、可能经过微调的模型承担具体执行任务。
英伟达高级总监乔伊·康威近期向The New Stack表示,该公司认为,多模型协同系统才是AI的未来方向。
在速度方面,英伟达表示Nemotron 3.5 Lightning的输出速度最高可提升4倍。英伟达的卡里·布里斯基在发布前的媒体简报会上也指出,能够针对特定工作流程对模型进行修改和优化,才是英伟达希望建立竞争差异的核心所在。
"通用智能体基准测试只是起点,在实际生产中,真正重要的是模型在具体任务上的准确性——这也是后训练发挥最大作用的地方,"她说,"我们让客户提前获得了Lightning的访问权限,以便针对专业工作流程对其进行定制。经过后训练,准确性显著提升,Lightning的表现超过了合作伙伴目前所使用的开源或专有模型。"
在与CrowdStrike、CodeRabbit等合作伙伴的合作中,英伟达发现,经过微调的开源模型Nemotron 3.5 Lightning在专项任务上的表现可以达到甚至超越更大规模的专有模型——前提是该模型已经过针对该任务的后训练。
随着企业对前沿模型运行成本的敏感度不断提升,开源模型的优势愈发凸显,尽管对其进行后训练的工作并不总是轻而易举。英伟达表示,其NeMo生态系统提供了简化这一流程所需的全套工具。此外,该公司还同步推出了一套完整的用于训练编程智能体的强化学习数据集。
在多模型系统的架构中,路由器是决定由哪个模型处理哪类任务的核心组件。路由本身逻辑相对直接,但决策过程颇为复杂。NeMo Switchyard是英伟达推出的新开源路由库,Kong、OpenRouter、LiteLLM等现有路由器和AI网关已开始将其纳入自身产品体系。
"我们与整个生态系统协同合作,"布里斯基表示,"我们希望确保自身能够深度集成,让我们的库融入开发者已在使用的工具中。"
Switchyard本身以Rust语言编写,但由于开发者通过API与其交互,因此可以无缝嵌入现有技术栈,几乎无需额外工作。开发者可自定义模型池,并设置路由规则与策略,通过可调节的算法在质量、延迟和成本之间灵活取舍,以满足不同工作流的需求。
在英伟达的内部基准测试中,一套由Switchyard路由、混合多个开源模型与Anthropic Opus 4.8的系统,在保持前沿级别准确率的同时,将任务完成成本降至单独运行Opus的约三分之一。
早期合作伙伴的数据也印证了类似结论:LangChain在145项多轮深度智能体任务中,通过仅将7%的调用路由至前沿模型,实现了74%的成本下降(但准确率有6%的下滑);Ramp则表示,在其内部SWE-Bench测试中,系统在匹配前沿模型性能的同时,成本降低了58%,运行时间缩短了33%。
目前,Nemotron 3.5 Lightning已在Hugging Face、ModelScope、OpenRouter以及build.nvidia.com上以英伟达NIM微服务的形式提供。NeMo Switchyard也已在GitHub上线,更多合作伙伴集成即将推出。
如果英伟达的判断正确,智能体系统确实会演变为由多个模型协同构成的集成体,那么路由器将成为成本与质量决策真正落地的关键层级——而英伟达显然希望,凭借其开放、易于定制的模型,成为路由器在高频任务中的优先选择。
Q&A
Q1:Nemotron 3.5 Lightning是什么类型的模型,有什么特点?
A:Nemotron 3.5 Lightning是英伟达推出的一款拥有300亿参数的混合专家开源模型,由Nemotron联盟参与开发。其主要特点是速度快(输出速度最高提升4倍)、易于定制,推理能力接近参数量更大的Nemotron 3 Super模型。它的核心定位是在多模型系统中承担执行层任务,配合大型前沿模型协同工作,适合企业针对特定工作流进行后训练和微调,以较低成本实现接近或超越大型专有模型的性能。
Q2:NeMo Switchyard是什么,它如何帮助降低AI使用成本?
A:NeMo Switchyard是英伟达推出的开源模型路由库,用Rust语言编写,通过API集成到现有技术栈中。它允许开发者定义模型池并设置路由规则,根据质量、延迟和成本需求,动态决定将请求分发给哪个模型。实际效果显著:英伟达内部测试中,混合路由系统将成本降至单独运行Opus的三分之一;LangChain实现了74%的成本下降;Ramp在保持性能的同时成本降低58%、运行时间缩短33%。
Q3:Nemotron 3.5 Lightning和谷歌的Gemma 4 31B相比表现如何?
A:根据Artificial Analysis的智能指数评测,在通用基准测试上,Nemotron 3.5 Lightning和Nemotron 3 Super均落后于谷歌同等规模的Gemma 4 31B。但英伟达认为,通用基准测试只是起点,真正关键的是模型在特定任务上经过后训练后的准确性表现。在与合作伙伴的实测中,经过微调的Nemotron 3.5 Lightning在专项任务上的表现可以达到甚至超越更大规模的专有模型。
热门跟贴