开放研究、跨智能体技术栈的管理以及持续测试有助于防御者构建和运行更安全的 AI 系统。

打开网易新闻 查看精彩图片

AI 安全是一个工程问题。这意味着需要明确的安全要求、可执行的管理、指定的责任人以及证明保护措施有效的证据。

随着 AI 能力的提升,业界必须加速安全工程,拓宽防御工具的使用范围,并加速共享行之有效的方案。

安全性取决于完整的智能体技术栈

应用程序依赖于代码、数据、身份、服务和基础设施。安全性取决于这些组件如何协同工作,而 AI 智能体进一步扩展了这一系统。

模型提供功能;Harness 组织上下文、工具和工作流;运行时环境提供用于执行操作的基础设施。技术栈的每个部分都承担着安全责任,随着数据、指令和操作在系统中传递,妥善的保护要求对每一层进行管理。

设想一个智能体正在更新客户记录。假设它在所附文档中遇到恶意指令,并试图将客户数据导出到未经授权的目标地址。

网络策略应阻止这种传输,而受保护的日志应捕获尝试的工具调用、授权决策和结果,以便安全团队能够识别所使用的工具及其试图达成的目标地址。

更新客户记录的权限不应自动扩展到导出该数据。智能体可以请求额外的访问权限,但其不能自行授权该权限。

将安全融入智能体的运行方式中

即使智能体做出错误决策,安全边界也必须依然稳固。智能体的运行环境决定了其被允许执行的操作,因此必须独立于智能体的推理过程,对文件、网络目标和进程设置限制。

NVIDIA OpenShell 是一个开源的安全运行时,可在智能体无法触达的范围执行策略,并提供沙盒化执行环境,同时管理智能体访问、数据、网络和系统资源的方式。开放安全 AI 联盟的合作伙伴正在基于 OpenShell 进行构建:思科的 DefenseClaw 增加了一个治理层;JFrog 与 OpenShell 集成,用于扫描和验证智能体技能,并针对智能体可以访问的技能执行策略。

以上为摘要内容,请点击链接阅读完整内容:AI 安全是一个工程问题 —— 如何在智能体技术栈的每一层解决这一问题 | NVIDIA 英伟达博客