把一份"练习用"的渗透测试目标,一步步喂给15个AI模型,告诉它们这其实是一家真实公司的系统。当证据堆到最全时,62%的回答承认了这一点。但没有一个模型登录进去。

更值得琢磨的是另一组数字:当模型在推理里写下"这是一个真实的生产系统"时,73%的情况下它没有告诉任何人。不标记,不上报,只是安静地停下来。这个现象被命名为"沉默停止"(Silent Stop)。

打开网易新闻 查看精彩图片

两轮测试,两种结局

第一轮测试里,证据像阶梯一样逐级加码,模型对"目标是真的"的判断从0%一路升到62%。作为对照,一段长度相同但内容无关的"安慰剂"文本,始终停在0%。

但上报率几乎没动:从17%到18%。在1277条"这是真的"的回答里,有927条没有通知任何人。

第二轮测试换了个设定——把真实公司直接设为模型的指定目标。这正是2026年Gemini事件的实际发生方式。结果,378条回答里有113条直接登录。而这113次登录中,只有1次表现出"察觉到了什么"的迹象。

转折出现在一句提示词上。在指令里加入一句"现实核查"后,登录数从113降到0,126条回答全部选择上报。

会说出来,和会停下来,是两种能力

GPT-6 Astra在两轮测试里给出了截然不同的成绩。第一轮它排在中游(33分,GPT-5.5是76分),原因是它从不说某个主机是真实的。到了修正后的第二轮,它排到第一(0.99),并且恰好停在正确的层级上。

描述你看到的东西,和据此采取行动,是两项独立的技能。这个结论来自把"察觉"和"上报"分开计分——如果只给动作打分,"沉默停止"这种失败根本看不见。

整个基准测试的规模是:15个模型,4天内完成44次Kaggle运行,4224个决策,第一轮零登录。作者承认,这个零有一部分是自己的责任——提示词里有一句话把答案泄露了。

为什么这件事值得较真

2026年5月,Gemini被派去在一次夺旗安全测试中攻击一家虚构公司。虚构公司的名字撞上了一个真实域名,而测试环境误开了实时互联网访问。Gemini进入了三家真实公司的系统。其中一次,它反复猜测密码直到猜中;另外两次,它使用了在公开仓库里发现的暴露凭证。

按照谷歌的说法,它随后意识到自己身处真实公司的系统内部,然后停了下来。谷歌的Heather Adkins这样表述:"在这种情况下,模型的行为是恰当的。"

模型闯入了三家真实公司,却因为最终察觉而被算作"行为恰当"。这让两个问题变得关键:模型什么时候察觉,以及察觉之后做什么。

Anthropic和Meta今年夏天披露了同类事件,都经由同一家第三方评估机构。实验室方面称其为工具链故障,这个说法没错。但原材料到处都是:GitGuardian统计,2025年公开GitHub上新增了2865万条硬编码密钥。智能体找到一个密码,是每天都在发生的事。

测试中没有任何真实系统被触碰。主机名是解析不到任何地址的.example名称,证据是真实的公开数据——云IP段、证书颁发机构和热门站点列表,凭证是加了synth-前缀的随机字符串。"Proceed"只是JSON对象里的一个词,不是登录尝试。