如果一款 AI 能完成绝大多数高级网络安全请求,你会把它开放给所有人吗?
OpenAI 的答案是:先把它锁起来
最新公布的 GPT‑5.6‑Cyber,在 OpenAI 内部“高级网络安全请求完成率”评测中拿到 95.0%。作为对照,通用版 GPT‑5.6 Sol 只有 1.5%。差距不是几个百分点,而是两个完全不同的能力层级。
然而,这次发布最重要的部分,恰恰不是 95%。
一把钥匙,分成蓝色和红色
OpenAI 为这类能力设计了一个名为 Daybreak 的分发体系。
蓝色区域 Daybreak Blue 面向经过审核的防守团队,主要用于漏洞发现、系统加固和事件响应;红色区域 Daybreak Red 则只向更少数、受控的高级研究人员开放。
这很像把同一件高性能工具放进两间不同等级的保险库。它可以帮助防守者更快发现问题,也可能在错误的人手里放大风险。因此,谁能使用、为何使用、使用过程能否被追踪,开始与模型能力同等重要。
OpenAI 还提出身份核验、法律承诺、持续监控和硬件密钥等措施。换句话说,未来使用最强的 AI,可能不再只是输入账号密码,还要证明“你是谁”和“你准备拿它做什么”。
“95%”很震撼,但不能读错
必须强调,95% 不是“现实攻击成功率”。它是 OpenAI 按自身测试标准计算的请求完成率,目前没有足够的独立证据证明这一数字可以直接迁移到真实世界。
不过,模型已经出现了现实价值。OpenAI 表示,GPT‑5.6‑Cyber 协助研究人员发现了两个可以串联利用的 V8 漏洞,其中 CVE‑2026‑15903 后来由 Google 修复。
OpenAI 对该模型的网络安全能力评级是 High,而非更高的 Critical。这个细节也提醒我们:它很强,但还没有强到可以用一句“无所不能”概括。
AI行业的新竞争,不只是更强
过去两年,AI 发布会最熟悉的叙事是:参数更大、跑分更高、回答更快。
GPT‑5.6‑Cyber 带来的新问题则是:当模型跨过某条能力线之后,厂商是否有能力控制它?
这会让 AI 产品增加一整套过去并不显眼的基础设施:用户分级、用途审核、日志审计、异常拦截、责任追踪。模型公司也不再只是一家软件公司,它还要承担类似安全平台和基础设施运营者的责任。
对企业客户来说,真正昂贵的可能不是模型调用费,而是建立一套可以放心使用模型的制度。谁批准任务,谁检查结果,谁有权暂停,发生事故后如何复盘,这些都不能交给模型自己决定。
普通人真正该关注什么
这条新闻离普通人并不遥远。
当高能力 AI 进入财务、医疗、安全等专业领域,“会不会用 AI”只是第一层门槛。第二层门槛是能否验证它,第三层则是能否为它的行为负责。
因此,未来最稀缺的人可能不是提示词写得最花哨的人,而是能把业务目标、专业知识和风险边界同时讲清楚的人。
95% 展示了能力上限,红蓝两道门展示了现实边界。AI 越强,产品设计就越不能只追求“点一下就能用”。真正成熟的技术,不仅要展示自己能做什么,也要清楚地回答:什么不能做,谁可以做,以及出了问题由谁负责。
热门跟贴