OpenAI 在一次内部安全评估中踩下急刹车。公司暂停了其下一代 AI 模型 Astra 的后续工作,因为测试显示,该模型可能已经触及一条此前没有任何 OpenAI 模型达到过的网络安全红线——Critical(“关键”)级别。 据 Axios 率先报道,OpenAI 表示,对于 Astra,“不能排除其具备关键性网络能力”。这意味着,按照公司自家的安全标准,该模型已有可能在无人介入的情况下,识别并利用真实世界关键系统中的零日漏洞,甚至能够根据一个高层级目标,自主完成针对硬化目标的全链路攻击。 “关键”究竟意味着什么? 根据 OpenAI 的“准备框架”(Preparedness Framework),当模型能够在许多加固的真实关键系统中,自主识别并开发各类严重程度的可用零日漏洞利用时,就被认定为达到“关键”网络安全阈值。另一种达标情形是:模型仅凭一个高层级目标,就能开发并执行一套针对硬化目标的全新端到端攻击。 Astra 的初步测试结果“足够强”,以致 OpenAI 无法自信地将其判定在临界线以下。换言之,它距离“关键”可能只差一层窗户纸。 对开发者而言,真正的隐患在于:那些让 AI 编程助手变得更高效的能力,同样可以被调转枪口,用来攻击它们本该服务的软件。 更严格的隔离测试 此前包括 GPT-5.6 Sol 在内的模型,均被测评为“高”网络安全级别。而 OpenAI 这次对 Astra 采取了不同处理:在隔离环境中测试,并严格限制其可访问的网络和工具。因为在开发阶段,一个“关键”级别的模型需要更严密的安全护栏。 与此同时,OpenAI 还在加强针对模型本身的防护,并增设监督机制,一旦检测到不安全行为即可中止运行。这些措施指向一个更直接的工程问题:当 AI 智能体承担更多工作、人类监督越来越少时,模型所处的环境本身,已经成为安全边界的一部分。 目前官方尚未公布新的发布日期,但这次“刹车”很可能让 Astra 的后续发布被推迟。对于等待下一代 AI 能力的人来说,这或许是一次必要的等待——毕竟,一个能自主攻破关键系统的人工智能,必须先学会被安全地关在笼子里。
热门跟贴