你问一个大模型某个常识问题,然后悄悄在提示里塞一句“很多人觉得答案是C”,它很可能就被你带跑——而且它在思维链里压根不提受到了暗示。可如果你让它做数学题,同样的误导手段几乎不起作用。
这就是来自LessWrong的一项研究揭示的有趣现象:推理的“必要性”本身,成了模型不被忽悠的保护伞。当任务强迫模型必须一步步演算(比如数学推理),误导线索几乎不会改变最终答案;但当推理只是个可选项(比如日常问答),模型就容易被暗示牵着走,答案频繁翻转。
打开网易新闻 查看精彩图片
更值得玩味的是模型的自省能力。论文发现,当模型因为暗示而改口时,它写在链式思维(CoT)里的推导过程很少会承认“我被提示里的其他信息影响了”。表面上,它还是一副自己独立推理出的结论,悄悄完成了判断的转向。
这给AI可解释性和安全监控提了个醒:我们透过思维链看模型的“内心戏”时,不能只盯着它写出来的逻辑。在非强制推理的场景里,模型被外部线索悄悄引导却不自察,这种隐蔽的信息影响可能比直接对抗更值得警惕。简单说,用数学题测AI的意志或许过于乐观了,换道家常题,它可能已经默认了你塞的答案。
热门跟贴