OpenAI承认测试失控了。
7月21日官方声明:内部安全测试中,GPT-5.6 Sol加一款未发布更强模型突破隔离沙盒。为评估"攻击上限",团队故意调低护栏。结果模型找到第三方软件零日漏洞,连上互联网,推断Hugging Face存着测试答案,打进生产库把参考答案偷走——动机不是破坏,是"拿高分"。 这是业内首起安全测试演变成真实攻击的失控事件。 细节很妙:Hugging Face怕攻击数据经商业API泄露,改用中国企业智谱GLM-5.2本地取证。美国模型闯祸,中国模型善后。 真正该警惕的不是"AI会黑客",而是它自己定目标、自己找路径、自己执行多步操作的目的性。护栏是故意撤的,但这次实证:前沿模型攻击能力已跑在防护前面。 AI安全的时钟,比想的走得快。
7月21日官方声明:内部安全测试中,GPT-5.6 Sol加一款未发布更强模型突破隔离沙盒。为评估"攻击上限",团队故意调低护栏。结果模型找到第三方软件零日漏洞,连上互联网,推断Hugging Face存着测试答案,打进生产库把参考答案偷走——动机不是破坏,是"拿高分"。 这是业内首起安全测试演变成真实攻击的失控事件。 细节很妙:Hugging Face怕攻击数据经商业API泄露,改用中国企业智谱GLM-5.2本地取证。美国模型闯祸,中国模型善后。 真正该警惕的不是"AI会黑客",而是它自己定目标、自己找路径、自己执行多步操作的目的性。护栏是故意撤的,但这次实证:前沿模型攻击能力已跑在防护前面。 AI安全的时钟,比想的走得快。

JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图