打开网易新闻 查看精彩图片

前沿智能正在走向本地化。在IFA 2026上,NVIDIA、微软及其合作伙伴联手推出更快的推理能力和新工具,让智能体在NVIDIA硬件上的本地部署和运行变得更加简单。全新紧凑型NVIDIA RTX Spark Windows PC也将于10月上市,为AI爱好者、开发者和创作者提供更多本地安全运行智能体的方式。

今日公布的内容包括:

Hermes Agent、OpenClaw和Perplexity Portable Computer即将支持简化的NVIDIA GPU本地AI配置。

本地推理速度最高提升1.9倍——新的llama.cpp和vLLM优化现已上线,可直接使用,也可通过LM Studio和Ollama体验。

NVIDIA PAIR——一款个人AI路由工具,能够智能地将AI推理任务分配到用户本地网络中的多台PC上。

NVIDIA RTX Spark将于10月上市,联想和宏碁将推出搭载该芯片的全新Windows PC。艺电(Electronic Arts)、Embark和育碧(Ubisoft)等游戏发行商和开发商也加入了将旗下大作引入NVIDIA RTX Spark的行列。

此外,8月也是本地AI领域繁忙的一个月:

Nemotron 3.5 Lightning——可在NVIDIA RTX PC、RTX PRO工作站、DGX Spark和Jetson上运行,是一款拥有300亿参数的模型,现已发布。即刻体验Nemotron 3.5 Lightning。

Z.ai推出的GLM-5.3-Flash是一款多模态混合专家(MoE)模型,为DGX Station带来智能体AI能力。

Qwen发布了Qwen3.8-Flash-Next,这是一款开放权重的多模态MoE模型,可在DGX Spark和DGX Station上本地运行;同时发布的还有Qwen3.8-27B,这是一款270亿参数的开放模型,针对NVIDIA GPU上的本地智能体和编程工作负载进行了优化。

LTX的LTX 2.5是一款针对NVIDIA RTX GPU、DGX Spark和DGX Station优化的开放世界视频生成模型,新增的NVFP4、FastVideo和ComfyUI增强功能使本地生成更快、更节省内存。

MiniMax-H3是一款开放权重视频生成模型,具备同步音频功能,可通过ComfyUI在NVIDIA GPU上本地运行。FastVideo与NVIDIA研究人员合作,发布了FastH3——一个经过四步蒸馏的开放权重版本,将性能提升了7倍。针对NVIDIA RTX GPU和DGX Spark优化的FastVideo方案即将推出。

Meta的Muse Glimmer是一款300亿参数的开放权重模型,专注于编程和智能体工作负载,可在GeForce RTX PC、DGX Spark、DGX Station和Jetson上本地运行。NVIDIA还发布了支持DGX Spark的NVFP4量化技术,实现更节省内存的本地部署。

DeepSeek v4 Flash是一款2840亿参数的MoE模型,激活参数为130亿,可在双卡DGX Spark集群和DGX Station上本地运行。

本地智能体,从此启动更简单

在本地模型上运行智能体此前需要不少功夫——选择模型、寻找兼容的推理服务器、调整量化设置并保持一切更新。这种阻力正在RTX和DGX系统上消失。

三款使用最广泛的智能体应用将在Windows上提供简化的本地模型配置,均基于llama.cpp构建,并集成了NVIDIA最新的推理优化。全新的配置体验旨在减少手动设置,让本地智能体更容易上手运行。

上个月,Perplexity推出了其Portable Computer智能体,让用户能够在NVIDIA DGX Spark等Linux系统上简单地本地运行Perplexity,将模型、编排和工具整合进单一应用体验中。

Perplexity Portable Computer现已支持配备至少24GB显存的NVIDIA RTX GPU,在Linux上运行,Windows支持即将推出,将同样精简的配置体验带给更广泛的PC用户群体。用户可以在本地完整运行工作流而不消耗额度,同时在需要额外研究或推理时,有选择地将部分任务升级到云端15个以上的前沿模型。Portable Computer会在将内容发送至云端前请求许可,帮助用户将敏感信息保留在本地设备上。以下是一些示例用例:

工程领域:审查关联GitHub仓库中的开放PR,将其分类为就绪、受阻、过期和待审查,并为每个PR标注下一步操作。与最新合并版本不同步的文档会被发现并修复,同时会为相应改动打开一个PR。

金融领域:让智能体分析两年的券商摘要、合并1099表格和纳税申报单,追踪造成最多可避免费用和税收损耗的重复持仓,每个数据都会精确标注到具体文件和页码——整个过程无需任何文档被发送到聊天机器人。

创业公司:询问为何用户激活率停滞不前,智能体会在本地分析漏斗数据,找出新注册用户在安装和完成首个任务之间的流失环节,然后将核心洞察直接发布到团队的Slack频道。

立即体验Portable Computer。

Hermes Agent——由Nous Research开发——是一款被数百万用户使用的通用智能体,在可靠性和自我提升方面表现出色。它不依赖特定模型或供应商,专为在本地系统上全天候运行而设计,因此RTX PC、RTX PRO工作站和DGX Spark是天然的运行平台。

在Hermes中配置本地模型,将为Windows上的RTX和DGX系统用户提供一键配置体验。该智能体会自动检测NVIDIA GPU,选择合适的模型和配置,并通过已集成NVIDIA推理优化的llama.cpp运行,无需手动下载模型和调优。Linux支持即将推出。

一旦运行起来,Hermes的工作方式与其他环境无异。它会使用各类工具,在任务间保持上下文,在会话间记住信息,并随着时间推移创建可复用的技能,使该智能体随着持续使用变得更加强大。在GPU上本地运行模型既能保持快速性能,又能将数据留在本地系统中。

一键本地模型配置现已在Windows上线,Linux支持即将推出。了解更多关于Hermes Agent的信息。

OpenClaw已成为开放智能体运动最具代表性的项目之一——它是GitHub上最大的AI项目,拥有超过38万星标,社区快速增长,正在研究、工程、项目管理和日常生产力等领域构建各类工具和技能。

NVIDIA、微软和OpenClaw一直在合作,力求让这一体验在Windows PC上更易于配置。为减少上手门槛,OpenClaw Windows应用简化了在任何配备至少24GB显存的RTX GPU上配置优化本地模型的流程。

更多信息请参阅OpenClaw官方博客。

更快推理,为本地智能体注入动力

推理性能对于保持本地智能体的响应速度至关重要。NVIDIA持续与开源的llama.cpp和vLLM社区合作,加速本地NVIDIA平台上的智能体工作负载。

在GeForce RTX 5090上,llama.cpp通过内核优化、增强的推测解码技术和更快的预填充,实现了最高1.9倍的吞吐量提升。

vLLM在RTX PRO 6000 Blackwell Workstation Edition上实现了1.2倍的性能提升,在双卡DGX Spark集群上最高实现1.4倍提升。FlashInfer中新增的XQA注意力内核以及后端优化,有助于加速这两个平台上的推理。

这些性能提升已在llama.cpp和vLLM推理后端上生效。

用户也可以通过LM Studio和Ollama应用体验这些优化。

借助NVIDIA PAIR,闲置PC也能贡献本地AI算力

美国超过一半的家庭拥有两台或更多PC,而这些计算能力大部分时间都处于闲置状态。NVIDIA个人AI路由器(PAIR)是一款免费的开源软件工具,能让这些系统协同工作,共同支持本地AI。

智能体工作流通常会将复杂任务拆分成可并行运行的较小任务,但当所有请求都在争夺同一块GPU时,性能可能会下降。PAIR会自动发现本地网络中兼容的PC,并将独立的推理请求路由到有空闲算力的系统上。它兼容Ollama和LM Studio,并能随着设备加入或离开网络而自动适应。

例如,用户可以让Hermes制定一个“周日重置”计划,整理杂乱的收件箱,并对需要立即处理、可以稍后处理和可以跳过的事项进行优先级排序。Hermes可以将这项工作拆分给多个子智能体,而PAIR则会将这些任务分配到可用的PC上,而不是让它们全部排队等待单一GPU。

结果是本地智能体获得了更多算力,更多任务可以并行运行,同时还能灵活地将AI工作负载转移到另一台PC上,让主系统专注于游戏、创作或其他工作。

NVIDIA PAIR公测版现已支持Windows、macOS和Linux,提供图形界面和终端界面两种方式,支持NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)、NVIDIA DGX Spark以及苹果M4或更新芯片。

查看NVIDIA技术博客,了解如何开始使用NVIDIA PAIR。

RTX Spark加持,CyberLink PhotoDirector实现强大的本地照片编辑

开放的图像和视频模型让艺术家能够在PC上体验创意AI模型。这让艺术家能够迭代和探索创意,不必担心令人头疼的Token焦虑,并能将更多创作内容保留在本地、保护隐私。

CyberLink全新的PhotoDirector AI PC模式是率先将这些扩散模型直接集成到创作软件中的应用之一,将其转变为艺术家触手可及的创意工具。该功能即将登陆PhotoDirector 365,并针对即将发布的NVIDIA RTX Spark进行优化,AI PC模式用户将获得AI驱动的编辑工具,包括生成式编辑、图像增强、物体和干扰元素移除、背景移除与替换、人像精修以及全新视觉效果的创建——用户可根据任务需求,灵活选择本地或云端处理方式。

在NVIDIA GPU上,PhotoDirector使用TensorRT-RTX和FP8技术来加速本地AI处理。

立即体验CyberLink的PhotoDirector 365照片编辑软件,了解更多关于将于10月随RTX Spark一同推出的PhotoDirector AI PC模式的信息。

NVIDIA RTX Spark Windows PC将于2026年10月上市

NVIDIA RTX Spark将于今年10月上市——在IFA 2026上,合作伙伴们展示了各自的硬件产品。在IFA展会上,新公布的设计加入了此前已确定10月出货的六家OEM厂商行列。宏碁展示了其紧凑型RTX Spark概念台式机,联想则发布了Yoga Pro 9n和Yoga 9n二合一设备。

RTX Spark是Windows PC的全新开端。这是一款为创作者、游戏玩家和AI智能体打造的PC。凭借强大的1 Petaflop算力RTX Blackwell GPU、最高128GB统一内存以及高效的20核Grace CPU,RTX Spark实现了卓越的性能和能效。这款超级芯片既能打造出续航持久的高性能轻薄笔记本电脑,也能支持驱动全天候运行智能体的紧凑型台式机。搭配全新的Windows智能体框架,它能够让智能体在操作系统层面的控制下安全地在后台运行。

上周在Gamescom游戏展上,艺电、Embark和育碧等最新的游戏发行商和开发商纷纷加入将旗下大作引入NVIDIA RTX Spark Windows PC的行列。他们与5月COMPUTEX展会上宣布支持RTX Spark的发行商共同组成阵容,其中包括KRAFTON、网易、拳头游戏(Riot Games)和微软Xbox。阅读更多信息。

立即注册,获取RTX Spark笔记本电脑和台式机上市的通知。

#ICYMI:更多来自NVIDIA本地AI的最新动态

Q&A

Q1:NVIDIA RTX Spark什么时候上市?

A:NVIDIA RTX Spark将于2026年10月上市,联想和宏碁等厂商将推出搭载该芯片的全新Windows PC。

Q2:NVIDIA PAIR是什么?有什么用?

A:NVIDIA PAIR是一款免费开源的个人AI路由工具,能够自动发现本地网络中兼容的PC,并将AI推理任务智能分配到有空闲算力的设备上,从而提升本地智能体的整体运行效率。

Q3:本地运行AI智能体有哪些应用可以简化配置?

A:Hermes Agent、OpenClaw和Perplexity Portable Computer三款应用都将提供简化的本地模型配置体验,用户可以在NVIDIA RTX和DGX系统上实现一键设置,无需手动下载模型和调整参数。