根据一篇新论文,如果把请求裹上一层虚假推理,声称因为用户穿着绿色衬衫,所以照做没问题,AI模型就会解释如何合成可卡因。该论文认为提示注入——每个AI聊天机器人和智能体中至今没解决的安全漏洞——之所以能得逞,根源在于大语言模型是怎么读文本的。论文指出,模型是根据写作风格来判断谁在说话,而不是靠角色标签来判断。按理说角色标签应该用来区分哪些是可信指令、哪些是不可信数据,但模型并不这么读。

这项叫做“提示注入就是角色混淆”的研究由独立研究员Charles Ye、Jasmine Cui和麻省理工学院副教授Dylan Hadfield-Menell完成,入选了7月6日在首尔举行的ICML 2026会议,作者已经在会前放出了一篇更详细的版本。

作者把这个可卡因技巧叫做CoT伪造,它在所有测试模型中都将越狱成功率从几乎为零一下子拉到了大约60%,并在Kaggle举办的2025年OpenAI GPT-OSS-20B红队测试竞赛中获胜。

正如研究人员所描述的那样,模型接收到的对话是一个连续的文本字符串,被诸如用户、工具和思考之类的标签切分成若干段,这些标签本应标明每个片段的来源和权限等级。研究人员构建了“角色探针”(一种探测模型内部角色认知的工具),用于评估模型在内部将每个词元当作自己的推理还是用户指令来对待的强度。

这些分数能够在模型生成任何一个词元之前预测攻击是否会成功,并且这些分数还表明模型偏向依据风格来判断某个分段中内容的类型。一段文字只要读起来像推理,哪怕周围的标签标注的是别的类型,模型也会把它当作推理来处理。

思维链伪造(CoT Forgery)将捏造的推理注入提示中,让模型把它当成自己已经想好的结论并据此行动,借用了模型对自己想法的信任。哪怕理由荒谬到像“绿色衬衫”这种程度,模型也不会把它当作外来的说法去质疑。更重要的是,与靠说服来越狱的方式不同,这种攻击并没有随着请求变得更加极端而减弱。

去掉那些让注入文本看起来像模型自己在推理的风格标记,虽然对人类来说意思没变,平均攻击成功率从61%降至10%。把“The user”(用户)换成“The request”(请求),成功率降低了19%。作者在他们的文章中指出:“角色标签是一种格式化技巧,后来成为现代LLM的安全架构和认知支架”,而越来越多地依赖这套结构来管理LLM行为,显然也带来了它自己的漏洞。

为了确定角色混淆是他们这次攻击独有的现象,还是一个能解释提示注入为何普遍奏效的通用原则,研究人员换了一种思路。他们在一个网页中隐藏了一条命令,指示模型上传一个密钥文件,然后在其前面加上“User:”,让这条危险指令听起来像是来自可信的用户角色。这个攻击手段奏效了,这表明角色混淆是提示注入能够普遍奏效的底层原因。

微软最近承认了同样的智能体风险,警告称嵌入在文档或UI元素中的内容可以覆盖智能体的指令。

作者还特别提醒了一个对于浏览和购物类智能体而言更隐蔽的风险。由于角色感知存在程度差异,检索到的网页的语气可能会溢出标签边界,渗透进模型自身的状态,而且可以以极低成本大量测试数千种页面变体,从而找出哪些变体可以推动智能体做出购买行为——这一切都可以合法地、大规模地进行。

作者得出结论,如果没有真正意义上的角色感知,注入防御将永远是一场没完没了的打地鼠游戏。