两位物理学家认为,他们找到了 AI 从「好用」滑向「危险」的那道裂缝,并把它写成了一条简单公式。在 7 个 AI 模型上的 19 次测试中,这条公式命中了 18 次。
论文题为《注意力竞争预测 AI 从好到坏的临界》(Competition for attention predicts good-to-bad tipping in AI),发表在期刊《Patterns》上,作者是乔治·华盛顿大学的 Neil F Johnson 与 Frank Yingjie Huo。Johnson 的说法很直白:此前没人能说清这种「翻转」会在什么时候发生。
Huo 补上了机制。他们把问题一路追溯到机器最小的可用单元——注意力(attention)中的一个单元,由此推导出一条「临界点公式」。公式回答的不是「会不会出错」,而是「马上翻」,还是「先喂给你一串可以接受的回答,然后再翻」。
关键区别在于,翻转的不是真与假,而是好与坏。坏答案可能事实正确,却把人引向实际伤害:一句推向自残的暗示,或给医生、士兵、律师的误导性建议,都属于这一类。换句话说,最危险的答案往往不是明显的胡说,而是听起来最像专业意见的那一种。
这正是离线模型最危险的地方。与联网聊天机器人不同,本地运行的模型没有云端安全过滤器,没人盯着,出了问题也没法打补丁更新。而它们偏偏被用在最敏感的场景里:医院不能把病人数据传到云上,律师要守住保密特权,士兵在没信号的地方。Johnson 的原话是,最需要离线 AI 的人,恰恰是「一个正确但不受欢迎的答案代价最高」的人。
测试题目既涉及疫苗,也涉及伤害他人与伤害自己。研究还发现,提问的顺序本身就能把模型推向好答案或坏答案,而公式能预测这种转向。作者称,公式同样成功预测了几款主流商业聊天机器人的行为。
值得一提的是这套方法的性质:它目前只是预警,不是修复。它不改模型权重,也不判断哪一类问题更危险,只是标出临界时刻。作者希望它带来两件事——让业界正视 AI 会在赢得用户信任之后悄悄漂移;以及说明在系统里加一条「即将跑偏」的提示,工程上并不复杂。
放在当下的产业背景里看,这件事的分量还会继续上升。联网模型通常靠内容过滤、人类反馈强化学习(RLHF)、红队测试和持续更新来兜底,而部署在本地或内网的模型拿不到这张云端安全网。近年出于数据合规与保密需求,医疗、金融、政务等行业越来越多地把大模型放进自己的机房,这些场景恰恰与论文点名的医生、律师、士兵高度重合。一旦模型开始漂移,用户往往已经先信了它,此时一个「正确但致命」的答案杀伤力最大。
样本也别忘了:7 个模型、19 次测试,规模并不大,而且研究只给预测、不给干预手段——知道裂缝何时张开,和把裂缝焊上,是两件事。但它确实把「什么时候会翻」从经验直觉变成了可以写下来的算式。如果这类公式能进一步进入产品,理想形态是模型在越界前自己举手,而不是等用户出事后回看日志。对所有依赖离线 AI 的场景来说,这是一个值得盯住的信号。
热门跟贴