“一个加密推理块,加一段越狱提示词,喂给自家小弟模型,大哥的‘内心戏’就全吐出来了。成本只要720美元。”

这不是科幻小说。这是2026年8月,一个德国独立研究员干的事。他花了720美元,用Anthropic自家最便宜的Haiku模型,把Claude Opus 4.8加密的思维链一字不差地读了出来。然后用同样方法,偷了GPT-5.6 Sol和Gemini 3.1 Pro的思考过程。

打开网易新闻 查看精彩图片

更狠的是——他用这个漏洞,顺藤摸瓜查了几款国产主流大模型。结果Kimi-K3和GLM-5.2被检出明显的“记忆痕迹”,而DeepSeek干净得像一张白纸。他们偷顶级模型的推理轨迹来训练自己,留下了无法抹去的“指纹”。

打开网易新闻 查看精彩图片

一、720美元,把顶级模型的内裤扒了

为什么能偷?因为硅谷巨头犯了一个低级错误。

推理模型在回答复杂问题前,会先打草稿——生成一段内部推理,也就是“思维链”。这段推理对竞争对手来说价值连城:谁拿到顶级模型的思维链,谁就能用更低的成本训练出接近顶级的模型。

为了保护这个核心资产,OpenAI、Anthropic、Google对完整推理过程做了加密。用户付了钱,能看到账单,但返回的是一串密文。

但加密块没有绑定到具体的用户、会话或模型。一个加密推理块,可以跨会话、跨用户、跨模型地“重放”。

攻击方法简单到离谱:把旗舰模型的加密推理块,转手扔给同一家公司防守更弱的小模型,诱导小模型把明文“念”出来。旗舰模型藏得严严实实的思维链,就这么被自家小弟全抖了出来。

这就是AI界的“一个馒头引发的血案”。

打开网易新闻 查看精彩图片

二、不只是偷,还在公开数据里挖出了密码

研究人员不只是证明了概念。他们从GitHub和Hugging Face上收集了6708条公开的AI对话日志,用同样方法批量还原了315320段加密推理。

结果挖出了62个API密钥、33个密码、30个个人邮箱、24个访问令牌、7把私钥。这些信息从未出现在公开对话记录中,只藏在加密的“思维链”里。开发者公开分享对话日志时,根本不知道自己把密码和API密钥也一并交了出去。

打开网易新闻 查看精彩图片

三、Kimi为什么“被抓包”?

门开了,一个全行业都想知道的问题浮现:那些性能突飞猛进的国产模型,有没有偷偷“蒸馏”顶级模型的思维链?

研究团队做了两组实验。

第一组:诱导实验他们把Claude的思维链截取极小一截——不到1%——作为开头预填给Kimi。结果仅仅是这1%的“引子”,就让Kimi后续的推理风格发生了剧烈的“漂移”。在某些案例里,Kimi的回答几乎完全复刻了Claude的表达习惯。

第二组:记忆提取分析。研究团队测量了特定推理片段在不同模型中的“记忆重现难度”。数据展现出了断崖式差距:从Kimi中提取出这些推理片段的难度,比从普通模型提取要容易整整一百万倍。GLM也表现出类似的强记忆痕迹。

巧合在统计学里是常客,但一百万倍的概率差,不太能叫巧合。

打开网易新闻 查看精彩图片

四、DeepSeek为什么没事?

同一次检测中,DeepSeek的测试结果干净得反常。

因为Kimi和DeepSeek走的根本是两条路。

Kimi代表的路线:追求极致的工程迭代速度。如果训练中大量引入通过爬取、越狱获取的顶级模型思维链数据,模型就会不可避免地吸收这些数据的“底层指纹”——就像背了大量高考满分作文,考场上写出来的句子自然带着原作者的基因。

DeepSeek代表的路线:从DeepSeek-R1时代起,就走“纯粹强化学习自我演化”的路。模型靠自我对弈和试错来进化推理能力。它在自己的强化学习环境里一锤一锤砸出来的思维链,自然不会在一百万倍的统计分析中留下别人的痕迹。

做抄本的学者能考满分。但只有自己在荒野里开荒的猎人,雪地上才留不下别人的鞋印。

这篇论文发布后,迅速引爆技术社区。三巨头已确认漏洞并部署修复。但对Kimi来说,留下的“暗示性证据”无法在法律上直接证明蒸馏——论文作者反复声明这只能算“暗示性证据”,不能算因果证明。

但技术圈不关心法律,只关心证据。一百万人站在同一根针上,你说是巧合?

数据已经摆在那里了。硅谷加密了个寂寞。Kimi被扒了底裤。DeepSeek的答卷干干净净。

谁是靠偷来的内力称霸武林的,谁是自己一招一式练出来的——统计学这把刀,不会说谎。