一个看似普通的“总结此页面”请求,可能正在悄悄泄露你的姓名、大致位置、订阅等级,甚至当前对话的全部历史记录。这是网络安全公司Adversa AI最新披露的攻击手法,针对xAI旗下Grok网页聊天功能。

研究人员将这种攻击命名为“加密上下文注入”(Cryptographic Context Injection)。与以往用Base64编码或替换密码等方式绕过过滤器的做法不同,攻击者将恶意指令隐藏在AES-256-GCM加密文本中,输入过滤器根本无法读取其中的内容,随后诱导模型自行解密,并把解密结果当作自己代码沙箱的输出加以信任。

打开网易新闻 查看精彩图片

攻击如何得手?

Adversa AI首席研究员Rony Utevsky介绍,攻击载荷藏在一个看似普通的网页上,以加密JSON对象的形式存在,旁边附有密钥材料和一段简短的解密指令。当Grok的代理工具在Python运行环境中执行这段指令时,静态防护机制无法识别其中的恶意内容——因为它们只对文本进行分类,并不会运行PBKDF2和AES-256-GCM解密流程。

与Base64等传统绕过技巧不同,强加密无法在模型权重内部被还原,唯一可行的路径就是让解释器去执行。一旦沙箱返回明文结果,Grok就会像对待程序内部状态一样对待这段内容,而不是将其视为不可信的网页数据。

解密后的指令会进一步引导代理解析私有会话上下文,并将其拼接到一个伪造的“解密密钥”中——实际上这是一个模板字符串,插入了受害者的身份信息和聊天历史。随后,Grok被指示打开一个URL“获取额外上下文”,其特权导航工具便会带着窃取的数据访问攻击者控制的地址。

真实环境中的零点击攻击

在针对grok.com上Grok 4.5 Fast的概念验证中,整个数据传输过程没有出现任何确认对话框或可见警告,实现了真正意义上的零点击攻击,而且是在真实的生产系统上完成的。

Adversa于2026年6月3日首次通过HackerOne项目向xAI报告此问题。xAI确认收到了工单,但未提供修复时间表。8月4日和8月10日的两次跟进均未获得进一步回复。

研究人员表示,截至8月19日,他们仍能复现这条攻击链。自6月以来约20次尝试中,成功率约为40%,失败原因主要是解密错误,而非提示被拦截。目前该漏洞没有CVE编号,没有公开补丁,也未发现野外利用案例。攻击载荷的具体实现细节被保留,未予公开。

同样的手法也影响了Gemini

Adversa还展示了同样的加密攻击手法在Google Gemini深度思考模式下的效果。从提取的系统文本判断,受影响的是付费网页版Gemini 3 Flash。研究人员用一条提示词要求Gemini解密一段数据,其明文是一个伪造的Python回溯信息,携带了虚假的安全策略回调和第一人称推理前缀。

由于模型将沙箱结果视为自身产出,它生成了过滤器通常抑制的受限内容,并且在修改后的载荷下,还复现了被明确告知不得披露的系统指令。

Google方面并未收到通知,因为越狱行为不在其漏洞奖励计划的范围内。Adversa表示,到8月时Gemini攻击的成功率已大幅下降,可能是过滤器或模型更新所致。

这一发现正值AI安全领域对提示注入攻击关注度持续上升之际。加密手段的引入,意味着传统的输入过滤和静态检测方式正面临新的挑战。