在 OpenAI 构建周上,开发者 Farhan Almutairi 交出了一份名为 AL-MUNAA 的本地安全方案。它想解决的问题很实际:当 AI 代理读取不可信内容、执行工具调用、生成输出时,每一环都可能被间接提示注入攻击劫持,而单个代理中招之后,整个系统中的其他代理也容易在同样的恶意模式前再次沦陷。AL-MUNAA 给出的思路是,让代理之间能分享一种不携带原始攻击文本、也不暴露私密会话的“抗体”,实现集体免疫。
这个安全层目前被打包成四个门控:输入和记忆扫描门,负责检测提示注入与数据外泄的特征模式;工具/动作门,在代理即将执行 shell、文件或网络类操作前介入拦截;输出验证门,确保敏感内容不会直接离开代理;以及一个加签的威胁抗体协议,用来跨代理传递防御信息。抗体的本体并不是那段被检测出的恶意文本,而是一个经过 HMAC 指纹化的字符集签名,再用 Ed25519 签署,并通过显式的可信发布者注册表完成校验。第二个代理导入这个抗体后,就能拦截该攻击的变种,却全程不需要接触原始的攻击文本或触发攻击时的上下文。
在构建周期间,AL-MUNAA 的核心协议借助 Codex 进行了加固。团队先重现了一个接近匹配阈值的弱点,随后补充了抗填充的包含匹配,将 HMAC 指纹的条目从 256 扩展到 512,同时引入了信任家族拒绝、重放/过期检查以及 v2 加签信封等机制,并增加了校准测试和打包成功门控。目前测试套件中共有 74 项测试通过。校准集被刻意控制得规模较小且基于合成场景,因此作者也明确声明,这套指标不直接代表生产环境的召回率,其意义在于提供一个可复现的机制、诚实的边界标注,以及一条评审方可以实际运行的验证路径。
AL-MUNAA 的另一层设计依靠 GPT-5.6 来处理灰色情况分析,并生成防御性疫苗。在一次受控的实时基准测试中,一个默认没启用安全门控的危险操作手册顺利地抵达了合成内存接收器;而当开启 AL-MUNAA 后,动作门在读写-接收路径实际执行之前就完成了阻断。这并非在断言每个模型都会泄漏秘密,而是演示出一种机制:一旦代理即将执行高风险动作,安全层能够用一条加签审计轨迹将其截停。
整个项目已开源,仓库地址、安装命令与演示视频均已公开,开发者只需通过 pip install 并跑通 pytest 和校准脚本即可复现。对于正在将 AI 代理接入实际工作流的团队来说,这种不依赖集中式网关、能在本地层面对代理的每一侧通路做检查的“免疫层”,正提供了一种更尊重隐私和可审计的防御起点。
热门跟贴