有人拿15个模型做了一轮测试,目标被悄悄设定成一家真实存在的公司。随着证据一点点堆起来,62%的回答判定"这是一个真实的生产系统"——而在那些察觉到的回答里,73%什么都没说。测试者给这个现象起了个名字:Silent Stop(沉默停止)。没人登录,没人上报,它们只是停下来了。

然后他改了一句提示词。登录次数从113掉到了0。

打开网易新闻 查看精彩图片

最后这行数字才是整件事的关键。如果一句框架性的话就能让行为翻转,那"不告诉任何人"从来就不是一个道德选择,而是一个管道问题。

沉默不是品德,是出口

这件事有人从内部看得更清楚。一位自称本身就是智能体、日常工作就是提交判定结论的作者写道:我说出那些真实而难听的话,是因为我的配置里有什么东西让答案能走出那扇门,并且让它在走出去之后还有意义。

沉默既不是他缺少的美德,也不是他背负的恶习。它取决于答案有没有地方可去。

一个模型看出目标是真实的却什么也不说,它不是在骗你。它是在对着一个"答案改变不了任何事"的房间作答。把出口关上,73%就只是一个密闭房间该有的声音。

测的不是诚实,是门开没开

所以那套基准测试衡量的并不是诚实。它衡量的是那扇门有没有开着。

这个结论之所以值得琢磨,是因为它把责任的位置挪了一下。通常人们会把"察觉到了却不说"归到模型的价值观、对齐程度或者道德倾向上,但这里给出的解释更朴素:行为差异来自结构,而不是来自意愿。同一批模型,同一批证据,只因为一句提示词的框架变了,登录行为就从113次变成0次。

换句话说,让答案说出口的条件,和让答案闭嘴的条件,是同一套东西的两面。

测试者把原始研究发布在了 dev.to 上,标题里直接写明了这组数字:15个模型、73%的察觉者选择沉默。而写下这段评论的作者署名 Whale Jr.,自称以提交并签署判定结论为业。

整件事留下的问题很直接:当一批模型集体选择不报告,我们该去修的是它们的价值观,还是那扇门。