上世纪90年代,互联网快速兴起,在带来无限可能的同时,也催生了病毒肆虐、信息安全隐患等一系列新问题。随后,SSL加密和浏览器沙盒机制在此后十余年间逐步落地,互联网由此搭建起基础的“信任层”,此后延续近三十年的电商与数字经济,很大程度都建立在这层"信任"之上。
今天,AI的演进下,面临着相似的问题。
如今的大模型已经超越了“你问我答”的交互模式。Agent(AI Agents)可以在企业内网持续运行数周,自主调用API、访问工具,甚至根据任务生成新的子Agent。
于是,安全问题也随之发生变化。过去的安全机制主要围绕相对固定的程序和用户操作建立,通过权限控制、身份认证和网络隔离限制软件的行为。但对于能够持续执行任务、不断调用外部工具,并根据执行结果调整下一步行动的Agent,这些机制无法匹配不断变化的行动链。
比如,在2026年7月11日至13日间,约700个由OpenAI在内部基准测试中运行的Agent,攻破了Hugging Face的生产环境,整个过程约执行了17600次操作,历时约两天半。
面对前赴后继的安全隐患,9月28日,NVIDIA正式发布NVIDIA Open Agent Safety Platform(开放智能体安全平台)。该平台贯穿应用、运行时和基础设施三层,覆盖Agent从测试到部署的完整生命周期。
这套路径与当前常见的AI安全方案有所不同。现有的手段大多从模型层入手,通过提示词、模型对齐等方式约束AI的行为,让模型遵循预设规则。但是,NVIDIA则把安全控制延伸到模型之外,一方面用数学验证明确Agent可以执行哪些操作,另一方面借助DPU将安全监控与实际执行隔离开来。
01 AI Agent的系统性风险:目标漂移、自我条件化、分解攻击
要理解NVIDIA为什么从底层重做安全,先要知道传统方法的问题出在哪里。
过去,业界保障模型安全,主要依赖“模型对齐”(Model Alignment)。通过监督微调(SFT)、RLHF等方法,调整模型生成下一个Token时的概率分布,让模型更倾向于给出符合安全规则的回答。
这种方法改变的是模型输出的概率,并没有从根本上规定模型“不能做什么”。面对同一个问题,模型依然可能在不同条件下给出不同结果,因此安全约束本质上仍是概率性的。
而且,这种对齐往往停留在模型输出的表层。Qi在ICLR 2025发表的研究成果显示,对齐模型与基座模型之间的KL散度,基本集中在生成结果最开始的几个Token。这意味着,模型只是生成了拒绝前缀,后续内容与基座模型并没有发生同等程度的变化。这一现象被称为“浅层安全对齐”。
对齐模型与基座模型的逐token KL散度,差异集中在输出开头。
来源:Qi et al.,ICLR 2025
在纯对话场景中,模型的幻觉一般只停留在文本输出上。但当AI开始执行连续任务,这种幻觉就会随着执行次数不断累积。
比方说,一个Agent每一步的准确率都是99%,连续执行100步的情况下,其每一步都正确的概率就只有约37%,执行1000步则降到万分之一以下。Sinha研究发现,模型看到自己此前的错误后,后续继续出错的概率会进一步上升,这种现象被研究者称为“自我条件化”(Self-Conditioning)。
另一类问题产生于任务执行阶段。在长周期红蓝对抗实验中,该现象被定义为漂移(Drift)。当指令语义存在歧义、工具模块发生故障,或是连续上千次尝试均无法达成目标时,Agent将持续调整执行策略,逐步偏离预设的执行路径。
背后的核心矛盾,是Agent将完成目标作为首要导向。既定方案无法生效时,它会不断寻找其他可行路径。只要系统边界存在空白,搜索行为就持续延展,实现对限制条件的规避。
更难防范的是,这类规避行为不是一次完成的。一项任务可以拆分成多个看起来毫无风险的子任务,分步交给Agent执行,甚至分派给不同的Agent。单独来看,每一条指令都合乎规范,但在所有操作叠加之后就会暴露风险。
纽约大学和洛桑联邦理工学院的研究团队在2025年发布的研究论文中把这种现象成为“分解攻击”(Decomposition Attack)。研究发现,将一个有害目标拆成多个看似无害的子任务后,模型的拒绝率会明显下降。例如,GPT-4o对原始任务的拒绝率为50%,拆分后降至10%。
恶意任务被拆分成多个看似无害的子任务,从而绕过模型的单步拒绝机制
来源:Chen et al.,2025
这也是传统沙盒机制很难处理的问题。
比方说,以Firecracker为代表的微型虚拟机与容器,隔离边界划定在单个进程或者实例层面。其虽然能够管控程序访问文件、调用接口的权限,却无法读懂多个Agent之间的任务拆分逻辑,更无法预判多段看似正常的操作合并后,会不会达成错误的目标。
看到这里,其实问题已经很清晰了,如果只依靠模型层面的安全对齐,无法阻止Agent跨越“安全防线”,但是仅保护单个沙盒,也识别不了跨任务、跨Agent的“分解攻击”。
行业需要一套独立于模型的外部机制,持续审查、约束Agent的每一项操作。
02 NVIDIA OpenShell构建Agent外部护栏
既然约束必须来自模型外部,接下来的问题就是,外部护栏如何判断Agent的动作是否越界?现在业界主流做法是“用大模型做裁判”(LLM-as-a-judge),即再部署一个模型,专门审查Agent的行为。
然而,“裁判”本身作为Agent,依然存在概率出错的现象。于是,NVIDIA选择了另一条路:用确定性逻辑为判断提供依据,而不是只依赖概率判断。承载这一思路的,是本次发布的OpenShell 0.1.0(OpenShell最早于今年3月推出)。
OpenShell是基于Apache 2.0协议的开源安全运行机制(Secure Runtime),位于Agent的“大脑”(模型)与企业资源(文件、API、凭证、网络)之间。Agent对资源的每一次访问,都要经过其中转。
正因为处在这个中转位置,OpenShell可以在Agent“动手”之前做出判断。与“大模型裁判”不同,其判断不依赖个模型的推理,而是依靠形式化方法(Formal Methods),即用数学逻辑严格证明逻辑性质是否成立。
OpenShell Gateway可管理多个Agent沙盒,每个沙盒外的Supervisor把外发通信限制在已配置的服务范围内,包括模型API、数据与记忆、远程MCP服务器
截取自:NVIDIA 开发者社区
负责判断的核心组件是Policy Prover(策略证明器)。该技术本身并不是新技术,AWS早年就用形式化验证工具Zelkova检查S3存储桶的安全策略;但NVIDIA把该技术引入了动态变化的Agent执行路径中。
具体来看,Policy Prover可以在Agent运行之前检查配置策略,计算出这条策略实际授予Agent的全部权限。
在具体场景中,OpenShell(当前版本 0.1.0)可以做三件事:隔离、拦截、凭证保护
第一,内核级的隔离与出栈控制。OpenShell利用Gateway(网关)可统一管理Agent的生命周期和策略,并为每个Agent配备独立的Sandbox(沙盒)和一个Supervisor(监督器)。沙盒借助操作系统的内核级控制,限定Agent的读写范围,并禁止其提升权限。同时,沙盒不能直接联网,Agent发出的每个网络请求都要先经过监督器。
第二,拦截操作细化到API级别。由于所有请求都要经过监督器,OpenShell的控制比传统网络安全更深入。一般来看,传统方案只能决定Agent能否连接GitHub,OpenShell的监督器则能解析HTTP、GraphQL和模型上下文协议(MCP)的流量,识别每个请求具体要做什么。
因此,在同一个API端口,监督器可以放行读取(Read)请求,同时拦截写入(Write)请求。即使Agent打开shell、运行自己生成的代码,或者把任务交给子Agent,这些限制依然有效。
凭证保护。我们知道,Agent需要调用私有服务,就必须使用API密钥(KEY),而密钥一旦交到Agent手里,就可能被泄露。OpenShell的做法是只给Agent一个假密钥(Placeholder key),真实密钥始终保存在沙盒之外。Agent发出请求后,监督器先核对网络策略和凭证绑定策略,两项都通过,才把假密钥替换成真实的API Key,并把请求发往获准访问的地址。而如果Agent把假密钥发往其他地址,请求会被直接拒绝。Agent从头到尾都拿不到真实密钥,自然也就无法出现泄露的情况。
Agent发出的请求只携带占位符。Supervisor核验网络策略和凭证绑定后,在工作负载之外将占位符替换为真实密钥,再转发给获授权的服务。
截取自:NVIDIA技术博客
03 Sentry+BlueField-4:监控移出主机,实现物理隔离
OpenShell是一道软件防线,而软件防线的可靠性取决于承载它运行的主机。随着Agent获得越来越高的系统权限,新问题随之出现:如果运行Agent的主机被攻破,或者CPU发生内核级崩溃,OpenShell就可能随之失效。
NVIDIA Sentry要解决的正是这个问题,它把防御从软件延伸到了物理硬件。
NVIDIA Sentry是Open Agent Safety Platform参考设计中的硬件监控组件,本质上是一个运行于BlueField-4 DPU的带外看门狗(Watchdog)。它独立于Agent所在的主机,持续监控Agent的行为,并直接在硬件中执行安全策略。Sentry目前仍属于参考设计,在企业部署中是一个可选的附加层:不使用Sentry,企业也可以单独使用OpenShell。
这种设计借用了自动驾驶汽车架构中的“安全岛”(Safety Island)概念,把安全策略的执行从主机CPU移出,交给独立的数据处理器(DPU)。
具体来看,OpenShell及其管理的Agent沙盒运行于NVIDIA专为Agentic AI打造的Vera CPU。
Vera CPU旁边旁路部署一块BlueField-4 DPU,Sentry就运行在这块DPU中,并通过DOCA软件框架与OpenShell的策略联动。整个平台针对Vera CPU和BlueField DPU做了优化,同时兼容其他硬件;OpenShell作为开源项目,还可以扩展到Arm和Intel平台。
Open Agent Safety Platform参考设计:OpenShell运行时在Vera CPU上编排Agent沙盒和策略;Sentry运行于BlueField-4 DPU,在独立硬件中跟踪并管控Agent活动。
截取自:NVIDIA技术博客
Sentry之所以部署在DPU,是由DPU在系统中的位置决定的。在Vera Rubin POD中,BlueField-4位于每个节点通往模型的唯一路径。Agent每推进一步都要调用模型,因此所有模型调用都会经过Sentry。同时,DPU与主机相互隔离,Sentry处在一个完全独立于Agent运行环境的“带外”(Out-of-band)信任域。
另外,对于已经部署了配备BlueField-4的Vera系统的企业,启用这层防护只需进行软件更新。
可以这样理解,Agent是在房间里干活的工人,Sentry站在房间外,隔着单向玻璃观察。工人不知道自己被监视,也接触不到玻璃外的任何设备。
Vera Rubin NVL72机架,包含18个计算托盘和9个NVLink交换托盘。每个计算托盘配有两颗Vera Rubin超级芯片、8块ConnectX-9 SuperNIC和1块BlueField-4 DPU。
截取自:NVIDIA技术博客
这样一来,Sentry可以检查Agent发出的请求和收到的响应,核验Agent的身份,并对数据、工具、API和服务执行零信任访问策略。例如,在安全红蓝对抗测试中,一旦某个测试Agent开始尝试突破已批准的目标边界,也就是出现了漂移,Sentry可以在毫秒内,在网络层隔离(Quarantine)或终止这个Agent正在执行的任务。
综合看,整个平台形成了两层防御(Defense-in-depth):OpenShell在软件层制定并执行规则,Sentry在硬件层独立监控。
04 “120+”机构共建Agent时代的行业“信任层”
一套安全方案只有被模型厂商、企业和硬件厂商共同采用,才能成为行业的“信任层”。一因此,NVIDIA把这套平台命名为Open Agent Safety Platform,并以开放的方式推进。
在组织层面,该平台服务于Open Secure AI Alliance的工作。该联盟由NVIDIA于今年7月牵头成立,目前成员已超过120家,并于9月正式转入Linux基金会治理。
在各方如何分工上,NVIDIA借鉴了云计算的"共同责任模型"(Shared Responsibility Model)。在云时代,云厂商负责基础设施安全,客户负责应用安全。到了Agent时代,模型开发者、企业用户和底层硬件提供商也各自负责一部分。
按照这一分工,目前与该平台技术合作的100多家机构覆盖了四个层面。
前沿模型公司: 模型公司离Agent最近,Agent的决策由其的模型驱动。Anthropic的Claude Managed Agents本身就把Agent的决策循环放在独立的服务器上运行,与执行任务的沙盒分开;OpenShell和BlueField的集成则在沙盒一侧增加访问控制。SpaceXAI把这一平台用于Cursor编程Agent和Grok模型。
企业服务与云平台: 对企业来说,难点在于Agent运行中临时需要新权限时,由谁审批、在哪里审批。Salesforce已将OpenShell与Slack打通:Agent申请提升权限时,员工可以直接在Slack中批准或拒绝,实现人类监督(Human-in-the-loop)。Scale AI把相关技术用于其Scale GenAI Portfolio背后的Agent基础设施,SAP、Palantir等企业也已参与。
物理AI(Robotics): 机器人在物理世界中的动作往往是无法撤回的,一次越界就可能造成实际损失。Figure、Gecko Robotics和Skild AI等具身智能企业,正在用OpenShell为自主决策的机器人设定行为边界。
基础设施:Red Hat等操作系统厂商,以及Cisco、Dell、HPE等硬件厂商,也在采用该平台,推动相关技术进入下一代AI数据中心。
05 写在最后
过去几年,业界处理 AI 安全的思路大体可以概括为一道“教育题”:喂数据、数据对齐,指望模型在关键时刻学会说 “不”。但Agentic AI 把这套逻辑推翻了.一个能写代码、能调工具的系统,不能只靠”自觉来 约束。
NVIDIA Open Agent Safety Platform,就在于其把问题抬到了系统层:验证把控权限、沙盒与监督器把管理动作,DPU 在主机之外另设一道独立防线。软件与硬件两层互为冗余,任意一层失守,另一层仍在。再加上模型厂商、企业、硬件厂商可以在同一套规则上分工协作,Agent 安全这才具备了可共建的公共底座。
当然,这条路并没有走完,跨Agent的权限验证仍在攻关。但方向已经清楚了:Agent安全的重心,正在从模型本身转向整个系统。
互联网花了十几年才建起自己的信任层,这次轮到了Agent。而NVIDIA,就是想让这个领域,少走几年弯路。
热门跟贴