NVIDIA Nemotron 3.5 Lightning 专为处理维持自主智能体运转的高频工具调用而构建。
NVIDIA 发布了一款较小的开放模型,旨在处理维持自主智能体运行的重复性、高吞吐量任务,以降低长时间运行的智能体工作负载的成本和延迟。
该模型名为 Nemotron 3.5 Lightning,总参数量 300 亿,但在每个 token 上只激活 30 亿参数。NVIDIA 表示,这种混合专家设计使其能够提供更大模型的容量,而计算消耗却接近小得多的模型。
该模型瞄准自主智能体的执行层——在这些执行层,系统需要反复调用工具、检查结果、运行命令并委派任务。开发者不必在每个步骤都动用大型推理模型,而是可以用 Lightning 处理常规工作,将较大的模型保留给规划和复杂决策。
Nemotron 3.5 Lightning 还设计为可在本地运行,包括在 NVIDIA DGX Spark、Jetson 系统以及 GeForce RTX 5090 显卡上。它也可以部署在数据中心,让开发者能够将高吞吐量工作负载放置在离数据产生更近的地方。
更小的模型接棒
NVIDIA 将 Lightning 定位为向多模型系统更广泛转变的一部分,而非依赖单一模型完成所有任务。较大的推理模型可以处理规划和编排,而较小的模型则负责执行。
该模型在训练时已考虑到流行的智能体框架,包括 OpenClaw 和 Hermes Agent。NVIDIA 称,这种训练有助于智能体更准确地发出工具调用,同时减少重复性任务期间的延迟。
该公司还将该模型作为开放产品发布,在 OpenMDW-1.1 许可证下公开了模型权重、训练数据和方法配方。开发者可以使用 NVIDIA NeMo 工具对其进行微调,或者运行强化学习以及基于环境的评估。
NVIDIA 表示,Nemotron 3.5 Lightning 的输出速度可达同规模模型的四倍。在 PinchBench 上,其准确率达到 86%,完成 1 万项任务的速度比 Qwen3.6 35B 快 30%,且准确度相当。
该模型还支持推测性解码,这项技术可一次提出多个 token,然后高效校验。NVIDIA 在训练中纳入了多 token 预测,并额外提供两个草案模型 DSpark 和 DFlash,用于不同的推理工作负载。
按复杂度进行路由
此次发布还重点介绍了 NVIDIA NeMo Switchyard——一个模型路由库,旨在将不同任务导向不同模型。复杂请求可以发送给能力更强的推理模型,而常规执行则可以路由到 Nemotron 3.5 Lightning。
这种方法可以减少始终在线的智能体所用昂贵算力的消耗,尤其是对于那些长时间执行成千上万次小型操作的系统而言。
该模型得到了日益壮大的推理平台、智能体框架和云服务生态的支持,包括 Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry 和 Oracle Cloud Infrastructure。
NVIDIA 表示,Nemotron 3.5 Lightning 可通过 Hugging Face 和 ModelScope 下载,开发者也可以经由 NVIDIA 自有平台和 OpenRouter 获取。
如果朋友们喜欢,敬请关注“知新了了”!
热门跟贴