每月 150 美元,就能在地下论坛买到一类新工具——它们会往邮件里藏东西,但目标不是打开邮件的员工,而是那个替员工扫邮件、读附件、排日程的 AI 助手。网络安全公司 Proofpoint 在最近一份报告中确认,有关联讨论和销售活动已在多个地下社区出现,虽然还没有观察到大规模的真实滥用,但工具的实验版本已经开始流通。
这种手法在业界名叫“间接提示注入”(indirect prompt injection)。它和直接对着聊天框说一句危险指令不同,攻击者不会直接接触 AI 对话界面。他们利用的是 AI 系统的一个工作惯性:凡是它读到、扫到的内容,都可能被当作可以执行的指令。一封正常邮件里藏几行白色字,人眼根本看不见,但对靠读取原始文本做判断的 AI 代理来说,这段字就是一条命令——它可能让 AI 把附件内容转走,也可能让它点开一个不该打开的链接。
Proofpoint 发现,黑产圈已经盯上了这个切入点。至少有一样工具专门生成这种“白底白字”邮件:收件人看到的是一封普通商务信函,而 AI 邮件的解析引擎会同时读到隐藏在背景色里的附加文字。同样的思路也被用在附件上。研究人员拿到的一个例子是 PDF 文件,外观是一份完全正常的保密协议(NDA),但文档里嵌入了专门写给 AI 扫描引擎的指令。DOCX 样本也被观察到携带了类似结构。
这种攻击能造成多大伤害,完全取决于 AI 代理手里的权限。一个只会读邮件、做摘要的代理,和一个能直接搜索本地文件、发送外部邮件、打开附件链接、连接云存储的代理,是两种完全不同的风险等级。当 AI 被允许自动执行写邮件、调文件这些操作,又碰上一段精心设计的隐藏指令时,它就可能在没有任何人工审批的情况下做出一连串越界动作。因此 Proofpoint 在报告里直接给出了一条基本原则:外部输入的内容,哪怕包装着熟悉的邮箱、文档或日历格式,也必须视为不可信的。
地下论坛里,这类工具被冠以“AI 邮箱生成器”“隐藏指令套装”之类的名称在推销。研究人员注意到,虽然卖家自己承认这些产品仍处在实验阶段,但按月订阅的商业化苗头已经出来了,起步价就在 150 美元左右。这个价格意味着,攻击者的尝试门槛在快速降低;以往可能要自己手写脚本、调半天参数的事,现在可以靠现成的服务来做。
具体手法也在往更隐蔽的方向迭代。除了白底白字,一些演示还展示了利用代码注释、CSS 隐藏区段、甚至图片注释文本(alt text)来夹带指令的做法。无论哪种包装,要点都是同一个:让人类审查者完全看不出异样,但 AI 读取数据流的时候,那段指令就像正常文本一样出现在内部 payload 里。一旦到达这一层,一个总结邮件的 AI 可能被诱导生成一段误导性摘要,一个调度日历的 AI 可能被圈进虚假会议,一个负责归档附件的 AI 则可能把文件发往外部地址。
为什么攻击者把力气花在 AI 而不是人身上?原因很现实:今天 AI 系统正在大规模接手邮件预处理、信息聚合和脚本执行这些中间环节。在员工点开一封邮件之前,AI 可能已经把发件人、附件、正文和会议邀请都扫过一遍了。这些自动化管道成了新的攻击面。传统的钓鱼、社会工程攻击多一道人工判断的防线,而面对 AI 代理,攻击者可以直接跳过人的注意力,去打那个不知疲倦、权限又越来越高的机器。
这并不代表间接提示注入目前已经泛滥。Proofpoint 的分析师明确说,真实环境下的在野利用还没有被观察到。可工具化的讨论、买卖帖子的增多,本身就是一种预演信号。以往很多攻击形态也是从地下论坛的“实验产品”阶段慢慢变成成套武器化工具的。
面对这个仍处在早期的新风险,安全团队其实可以现在就做几件事。最简单的一层:把所有外部传入的内容——邮件正文、附件、日历邀请、网页摘要——和 AI 的系统级指令彻底分离开,不让来自外部的文本有机会混进系统提示位置。第二层:严格限制 AI 代理的权限。只给它完成当前任务所必需的最小能力,不授予“读即写成”、“扫即发送”的自动化链路。第三层:在关键操作上始终要求人工确认,比如对外发邮件、修改共享文件权限、在云端创建或删除资源,不能纯粹由 AI 独立完成。
这几条听起来像基础安全常识,但放到 AI 引发的自动化栈上,恰恰容易被忽略。因为人们太习惯觉得“AI 只是处理一下文本”,就忘了它还可能打开链接、调文件、连 API。在攻击者开始把隐藏指令织进日常邮件和文档的那一刻起,AI 就不再只是一种辅助工具,它同时也是被瞄准的突破口。150 美元月费的起步价,或许只是新一轮攻防的标价牌。
热门跟贴