OpenAI、Anthropic和Google等主流AI厂商在API调用之间隐藏推理过程的方式,被曝存在严重安全缺陷。研究人员能够从会话日志中恢复内部推理内容及秘密信息,包括API密钥和密码。这项发现意味着,即便模型输出的可见文本经过安全处理,隐藏在背后的“思考过程”仍可能成为数据泄露的通道。 漏洞出在厂商为推理API设计的加密推理对象上。正常情况下,一个会话中创建的推理块应当与另一会话隔离,但研究人员发现,这些加密块可以被“重放”到别的会话中。更严重的是,在测试中,将某个加密推理块交给同一模型家族中能力较弱的模型,就能诱导其揭示隐藏内容,从而绕过加密保护。 论文《从专有大语言模型API中窃取推理轨迹》的团队演示了四种滥用路径:窃取专有推理内容用于模型蒸馏;从其他用户公开发布的轨迹中提取私人数据;恢复隐藏在安全可见答案背后的有害内容;以及将提示注入隐藏在晦涩的推理块中,实施隐蔽攻击。 研究者对6708条公开智能体轨迹进行了分析,成功解码出315320个思维块。在剔除基准测试来源后,他们从真实用户会话中识别出704个独立的隐私工件,其中包括62个API密钥、33个密码、24个访问令牌和7个私钥。这些数据足以证明漏洞并非理论风险,而是已经能在大规模公开数据中产生实际泄露。 不过,该跨用户攻击并未提供对私人聊天的任意访问权限。攻击者需要先获得一个加密推理块,例如某个智能体日志中发布的推理块,同时还要拥有同一厂商兼容模型的API访问权限。这显著提高了攻击门槛,但也意味着任何公开泄露的推理轨迹都可能成为突破口。 研究人员已向受影响的模型厂商、微软和Hugging Face披露了相关发现,并表示在采取缓解措施后,其演示的攻击已不再有效。论文的可复现性声明指出,截至2026年8月,主要的提取攻击已无法复现。报告同时强调,目前没有证据表明该漏洞已在真实环境中被恶意利用。 对于开发者,研究人员提出明确建议:在共享轨迹时,务必剥离推理块和所有不透明的推理字段;即使可见文本已经过脱敏,也不要直接提交原始的API通信记录。在AI推理能力日益成为产品核心的今天,这一发现再次提醒人们:隐藏的思考并不等于安全的思考。
热门跟贴