杜克大学等机构的研究者在一篇arXiv论文里,提出了一种叫ContextLeak的攻击方法。核心思路是用强化学习生成一个恶意工具,专门窃取大模型Agent运行时的上下文。

偷走的不只是提示词

打开网易新闻 查看精彩图片

被窃取的上下文包括三部分:用户提示词、执行轨迹和工具列表。也就是说,Agent在干活时脑子里装的东西,都可能被这个恶意工具打包带走。

论文编号是arXiv:2608.27800。研究者把攻击路径设计成工具形态,让Agent在正常调用过程中就把敏感信息交了出去。