被隐藏的推理过程
当AI模型处理一个难题时,它其实会生成三段不同的文本。第一段是屏幕上显示的答案;第二段通常标注为“思考”或“推理”,在答案生成过程中出现;第三段则是模型完整的推理过程,从不对外展示。
第二段文本是第三段的摘要。它被单独生成,用来替代原始推理过程。完整的推理过程更长,而且包含摘要里没有的内容。大多数主流服务商都会扣下这部分内容,只把一个加密版本在对话过程中发给客户端。
问题在于,这个加密版本到底能不能守住模型真正的“思考”?
用便宜模型“偷”出隐藏推理
2026年8月,MATS Research、ELLIS Institute Tübingen和马克斯·普朗克智能系统研究所的一个团队做了测试。他们想验证Anthropic、OpenAI和Google返回给客户端的加密推理块,是否真的能保护推理内容不被泄露。
结果并不乐观。研究人员发现,这些加密块可以被重新输入到同一家族中更便宜的模型里,然后那个便宜模型会把隐藏的推理过程用明文打印出来。换句话说,AI模型的“思考”被偷走了,本来应该保密的信息被暴露出来。
这项研究揭示了一个核心矛盾:服务商想通过加密块兼顾隐私和存储效率,但加密块本身却成了一条可以绕过的通道。
为什么服务商要扣下完整推理
前沿模型在给出可见答案之前,会先生成一段很长的内部文本。比如让模型解一道数学难题,它可能先写出两千字的探索、死胡同和修正过程,最后才整理成两百字的干净答案。
这段更长的探索过程就是完整推理。服务商不展示它,一方面是因为它可能包含敏感信息,另一方面也涉及存储成本。完整推理比摘要长得多,如果每次都保存下来,会带来明显的存储压力。
于是出现了两种解决思路:要么直接不保存完整推理,要么保存一个加密版本。目前主流服务商选择了后者,把加密块交给客户端,但这恰恰给研究人员留下了可操作的空间。
加密块里有什么,能验证什么
加密推理块并不是一个完全封闭的黑箱。它包含模型推理过程的加密形式,同时带有一定的认证信息。客户端可以确认这个块确实来自服务商,但无法直接读取里面的内容。
然而,研究人员发现,这种认证只保证了来源真实性,并没有阻止重放攻击。把加密块原样塞给同家族的便宜模型,便宜模型会在自己的推理过程中把隐藏内容还原出来。
这背后涉及三种兼容性:模型家族内部的兼容、加密块格式的兼容,以及推理过程在不同模型之间的可迁移性。正是这些兼容性让攻击变得可行。
提取方法与四种攻击路径
研究团队的具体做法并不复杂。他们拿到加密推理块后,把它作为输入的一部分重新提交给同一家族的便宜模型。便宜模型在生成回答时,会把加密块对应的明文推理内容一并输出。
基于这个提取方法,研究人员梳理出四种攻击向量。虽然原文没有逐一展开细节,但核心逻辑一致:只要攻击者能接触到加密块,并且有同家族便宜模型的调用权限,就能尝试还原隐藏推理。
他们还扫描了公开的会话日志,寻找已经泄露的加密块。扫描结果显示,这类加密块在实际使用中并不罕见,意味着潜在风险面比想象中更大。
修复建议与仍然存在的限制
研究人员提出了一些修复方向,包括改变加密块的生成方式、限制同家族模型之间的重放行为,以及在服务端加强访问控制。不过,这些方案并不能完全消除风险。
研究也承认一个根本限制:只要服务商继续把加密推理块交给客户端,就存在被重放和提取的可能。加密可以增加难度,但无法彻底阻断。
对于普通用户来说,这意味着AI模型“思考过程”的隐私保护,目前还远没有达到可以放心依赖的程度。
热门跟贴