一项新研究揭示,OpenAI、Anthropic和Google等前沿模型返回给客户的加密“思维链”并非绝对安全。研究人员利用“加密痕迹重放”方式,将某一大模型生成的加密推理块输入其更弱的同门模型,并通过越狱该弱模型,成功以明文恢复出强模型的隐藏推理过程,全程未直接攻击强模型,也未触发其防蒸馏机制。
研究团队从GitHub和Hugging Face收集了6708条由Claude、GPT和Gemini生成的公开Agent轨迹,这些轨迹仍包含加密推理块。经过解码流程处理,共重建出315320个推理块。在120道Codeforces题目上的测试显示,解码出的推理内容与API报告的隐藏思考token数高度一致。
更令人担忧的是,这些隐藏轨迹包含真实敏感信息。在排除基准测试后的真实用户会话中,研究者发现了704个不同的隐私痕迹,包括62个API密钥、33个密码、24个访问令牌和30个个人邮箱地址,另有姓名、邮政地址、内部URL等技术标识。其中64个敏感信息仅出现在加密推理块中,在可见会话中完全找不到。
这意味着,即使用户看不到模型的隐藏思考过程,这些“不可见”内容仍可能被第三方通过旁路手段重新读取,给AI隐私保护和商业模型安全带来新的挑战。
热门跟贴