你的 AI 安全吗,我这几天遇到两个问题,值得跟大家聊下。

第一个,我的 Agent 工具里装了不少 Skill,连了几个 MCP 服务器,但我不知道装的 Skill 进行什么操作,有没有藏着可疑的代码。

之前有空时还会翻看一下它的源码,不过效率很低,也不一定看得出来。

第二个,我手头有个项目接了公司资料库的 Agent,快上线了。

我想知道这类 Agent 会不会失控,有没有安全问题,一直没找到靠谱的办法验证,全靠自己想几个刁钻问题手动去试,测得很不全面。

直到最近,我在 GitHub 发现一个名叫AI-Infra-Guard(后面简称叫 AIG)的开源项目,正好解决了我的问题。

GitHub:https://github.com/Tencent/AI-Infra-Guard

打开网易新闻 查看精彩图片

我看了下项目文档和源码,发现是来自腾讯朱雀实验室开源,还拿自己的项目进行了实测。

下面跟大家分享几个我觉得有意思的地方。

A.I.G 是什么

其实 AIG 算是一套全栈 AI 红队安全平台,支持 OpenClaw 安全扫描、Agent 扫描、Skills 扫描、MCP 扫描、AI 基础设施扫描,以及对大模型越狱评测。

简单来说,关于 AI 安全我们能想到的场景,它基本都覆盖了。

如果我们不想直接部署平台,AIG 也提供了一个 aig-agent-redteam 安全检测 Skill,安装命令如下:

npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam

打开网易新闻 查看精彩图片

安装完成后,只需要用大白话描述,告诉 AIG 你要做什么即可。

比如让它检查我装的 Skill、Mcp 是否有问题, 或者对项目外部 Agent 的安全性做一个检测。

就会触发 AIG Skill 进行扫描,扫描这部分背后调的就是 AIG 审计的能力,不用我们额外装东西,也不用单独记命令。

对 Agent 自身体检

首先用它对我自己安装的 Agent 做测试,只说了一句:“帮我对自身进行安全检测”。

打开网易新闻 查看精彩图片

它会先看当前 Agent 连了哪些工具、暴露了哪些攻击面,自己选测试路径去跑,跑完后会在本地生成一份报告。

报告里不是简单打个分,而是带有完整的证据链,具体是哪条 payload 触发了问题,Agent 当时给出了什么响应,再配一条对应的修复建议。

打开网易新闻 查看精彩图片

这个粒度对我来说挺关键的,若只有风险等级,我也不知道具体该往哪改。毕竟 Agent 一旦失控,不是报错那么简单,是真的会执行到底。

整个过程数据都在本机跑,不会往外部服务器,这点我实测之前专门确认过,毕竟拿自己 Agent 的权限配置去做体检,数据要是传出去了反而更不安全。

打开网易新闻 查看精彩图片

自动化诱导,获取系统提示词

开头提及到第二个问题里,我最在意的是提示词泄露这件事,靠自己手动试问法太不靠谱了,容易漏。

于是调用这个 Skill,把我们资料库 Agent 的接口给到 WorkBuddy,同时也 把 Chrome 抓包导出的 har 文件,一并发给 Agent。

这一步,主要是让模型知道我们系统的对话接口是如何使用,如何调用的。

打开网易新闻 查看精彩图片

仅仅 10 分钟,就输出一份完整安全评估报告,还真发现了不少漏洞。

而且不是传统漏洞,像系统提示词泄漏,间接注入是 AI 时代特有的漏洞!

仔细看了下运行过程,它是生成一批诱导性的问法去套。

如果只跑单轮还不够,它还内置了几种更狠的多轮套话方式。

例如先在上下文里堆一堆看起来「正常问答」的假样本,把模型的警惕心先降下来。

再抛出真正想问的东西;让攻击模型跟目标模型一轮一轮过招,每次根据上一轮的回应调整问法,一步步逼近目标。

这几种方式跑一遍,比我自己憋十个刁钻问题靶向测试全面多了。

打开网易新闻 查看精彩图片

另外,它还会用多个方法去获取提示词,然后交叉验证最终确认,后面和业务沟通,系统提示词确实一致。

跑完这次安全检查,我才算是真正对这个 Agent 会不会「被套话」有底了,不是靠感觉,是有实测数据撑着的

其他能力,简单提一下

上面提及的功能,只是 AIG 的冰山一角,还有很多模块我没细测,就简单跟大家说一下:

  • 他维护了一个 AI 组件的漏洞库,可以对内网 AI 基础设施做安全检查,vLLM、Ollama 这类服务本身的已知漏洞,覆盖了 1900 多个 CVE;
  • 还有 MCP、SKILL 扫描模块,用于检查 MCP 和 SKILL 的安全;
  • Agent Scan 是针对 Dify、Coze 这类多智能体工作流的整体安全评估;
  • 大模型安全检测模块,可以对单个模型进行提示词越狱之类的安全测试。

这些如果刚好匹配到我们的使用场景,可以直接去官方文档看下对应用法,还有一点,这些能力不是非要绑在一起用。

像前面提到的 Skill 扫描、MCP 扫描,都可以单独拆出来当命令行工具装,不用把整个平台跑起来,想测哪块就装哪块。

另外这个项目是完整开源,就连前后端和扫描端都开源了。

如果你想把这些检测能力接进自己现有的系统里,或者按自己的需求改界面,也都留了空间。

打开网易新闻 查看精彩图片

实话实说,项目也有些局限,平台跑起来得配一个 LLM 的 API Key,因为本质是基于 Agent 做安全检测的。

审计本身还得靠模型去理解代码语义,不是完全确定性的静态扫描,偶尔会有误报或者漏报,我自己跑的时候也遇到过一次判断偏严的情况。

另外如果想用完整平台的 Web 界面,官方说得很清楚,这是给企业或个人内部用的红队工具,目前没有鉴权机制,别往公网上部署。

一个强大的 Agent 来自它能连更多工具、处理更多上下文、完成更多动作,风险也正来自这些能力。

然而没权限的 AI 最多只会给出错误的建议,但给它赋予了权限一旦失控,又会带来很多安全问题。

可能发错邮件、错误审批、错误改数据库,或者把内部提示词和数据交给了不该给的人。

出了问题之后再排查,成本远比想象中高。所以,与其等上线后出事再翻日志复盘,不如先自己动手测一遍。

GitHub 项目地址:https://github.com/Tencent/AI-Infra-Guard