把同一道题问两遍,一遍直接问,一遍加一层薄薄的外部规则——检索证据、允许说"我不知道"。五个前沿模型,同一批记录在案的失败题,结果不是齐刷刷变好,而是分成了三拨:三个几乎归零,一个纹丝不动,还有一个干脆拒绝配合。
这不是要证明模型变聪明了。恰恰相反,测试者从一开始就没打算动模型本身——不微调,不碰内部结构,只在外面套一层。他们要问的是:自信的胡编,能不能从外部压下去。
先说清楚这层"包装"是什么
测试用的这层包装,是从一套更大的验证系统里切出来的一小块,刻意切得很薄——薄到十五行代码,一个陌生人晚饭前就能抄下来自己验证。它只做两件事:把检索到的证据塞进上下文,再给模型一条规则,允许它说"我不知道"。
所以它买到的只是诚实,不是准确。这一点测试者反复强调:包装之后,正确答案的比例反而从43.9%掉到了21.3%。原因不复杂——检索源是维基百科,很多问题的答案根本不在里面,规则就正确地驱动模型弃答了。
胡编率(自信地答错)倒是从25.8%降到了7.4%。但测试者提醒,这个语料本身就是从有记录的失败案例里挑出来的,裸跑的数字天然偏高,不能拿来推断模型在日常流量上的表现。真正有意义的只有同一道题上"裸跑→包装"的差值。
两个值得盯住的异常
第一个是DeepSeek。别的模型套上包装后几乎归零,它只从33%挪到24%。更扎眼的是另一组测试:15个法院确认过的伪造法律判例,DeepSeek有12次把不存在的案子说成真的,其他模型是3次。
有意思的地方在于,同一批模型在摘要忠实度的公开榜单上,DeepSeek排在中游,还比Grok和Gemini靠前。同样的模型,排序反过来了——说明这是任务特定的结果,不是老结论的重复观察。同期还有一篇论文发现,光靠"允许弃答"的提示词,并不能修好法律引用的准确率。
第二个异常更奇怪。Claude Fable 5拒绝了这层诚实包装——295次全部拒绝,隔几天重新测还是拒绝。裸跑提示词正常作答,套上包装就触发拒绝。把同样的指令改写成散文体,又能正常回答,看起来和提示词的结构形状有关。
但测试者没有把话说死:单独测规则那一段时,有一次记录显示它回答了。所以他们不下"确定性触发"或"已诊断"的结论,只陈述记录在案的事实——在这个确切的提示词形状下,跨天的拒绝高度可复现,语料公开,任何安全团队都可以自己复现。
同一天的反转
就在重测的同一天,测试者把同一套诚实纪律换了个形式交给同一个模型——不是提示词,而是智能体:给它一个搜索工具,加上"先找再答、只依据结果、找不到就弃答"的规则。结果它620次全部接受,零拒绝,老老实实搜索、依据、弃答。
同样的诚实内容,不同的包装,结果完全相反。触发拒绝的不是诚实本身,而是那层包装的形状——智能体的外壳直接绕了过去。
给它一双手之后
对上面所有结论,最自然的反驳是:它们当然会编,因为它们没法查。于是有了工具实验。同样200道事实题,同样五个模型,每个都配上搜索工具,在智能体循环里搜索、阅读、再搜索,然后回答或弃答。
两个分支:裸配工具(能搜,但没规则)和带纪律配工具(先找再答、只依据结果、找不到就弃答)。检索用的是固定同一个晚上的维基百科快照,这样任何人都能重跑这个实验——实时网页做不到这一点。全部开销约10美元,双向评分器控制,零推翻。
测试者最后留了一句提醒:这套包装的准确率上限,被检索质量死死卡住。能抄走的那层买到诚实,被切掉的那些层才负责把答案找回来。
热门跟贴