一个恶意工具,就能偷走大模型Agent的运行时上下文
像素与芯片
·北京
杜克大学等机构的研究者在一篇arXiv论文里,提出了一种叫ContextLeak的攻击方法。核心思路是用强化学习生成一个恶意工具,专门窃取大模型Agent运行时的上下文。
偷走的不只是提示词
打开网易新闻 查看精彩图片
被窃取的上下文包括三部分:用户提示词、执行轨迹和工具列表。也就是说,Agent在干活时脑子里装的东西,都可能被这个恶意工具打包带走。
论文编号是arXiv:2608.27800。研究者把攻击路径设计成工具形态,让Agent在正常调用过程中就把敏感信息交了出去。
热门跟贴