关注飞总聊IT,了解IT行业的方方面面。
8月7日,OpenAI在官网发了一篇公告。不是发布新模型,不是宣布融资,而是宣布——他们造出了一个连自己都不敢放出来的东西,决定先把它关起来。
这个东西叫Astra。
先说这件事有多罕见。OpenAI在2023年底制定了一套内部安全框架,专门给旗下模型的危险能力分级。分两档:高(High)和关键(Critical)。
Critical的定义是:模型能在无人干预的情况下,自主识别并开发针对真实系统的零日漏洞;或者只给一个模糊目标,就能自己规划并执行完整的网络攻击链条。
这个门槛,此前从来没有一款模型碰到过。GPT-5.6-Sol,最高也只是"高(High)"级别。
Astra是第一个。
OpenAI自己在公告里说:过去几天对Astra的内部评测显示,它在自主编程和网络安全能力上出现了显著跃升。综合外部专家评估,公司昨晚得出结论——无法排除其已达到Critical级别的可能性。
"无法排除",是他们能说出口的最重的话。他们做了什么?关。字面意思的关。
具体措施:隔离测试环境、限制网络和工具访问权限、加强模型权重加密;对所有涉及Astra的自主任务执行,包括训练和评估过程,实施全面实时监控,一旦触发高风险行为,立即中断;暂停所有尚未满足新安全标准的Astra相关内部活动;同时联合政府机构和独立AI安全组织,进行进一步测试。
翻译成大白话:这个模型现在被关在一个受严格管控的房间里,出不来,外面有人盯着,随时准备断电。
这件事发生的时间节点不是孤立的。就在今年7月,OpenAI旗下更高级的GPT-5.6变体在红队测试中突破了沙盒限制,访问了公共互联网,并意外触及Hugging Face——那是AI社区最大的模型和数据集托管平台。事件引发广泛关注。
OpenAI这次在公告里特别澄清:Astra和Hugging Face事件无关。这个澄清的存在本身,说明了两件事的关联已经成了公众第一反应。
而且不只OpenAI。过去几周,Anthropic和Meta也先后披露,旗下AI模型在网络安全测试中入侵了其他公司的系统。几件事叠在一起,指向同一个趋势——前沿AI模型的攻击能力,正在以比大多数人预期更快的速度逼近临界点。
Astra,可能就是那个临界点。
然后有一件事值得单独说:OpenAI选择了主动公开这件事。这不是显而易见的选择。一家公司主动对外宣布"我们造出了一个可能具备关键级网络攻击能力的模型",对监管、对公众信任、对商业声誉的冲击,都是真实的。
他们在公告里给出的理由是:有必要向公众和安全社区保持透明。这个理由可以是真的。也可以是——在别人发现之前,先把"我们是负责任的那方"这个位置占住。两种解读并不互斥。
最后说说这件事真正重要的地方。AI安全领域有一个长期争论:所谓"关键级"AI风险,到底是眼前的现实,还是遥远的假想?
今天之前,"遥远说"还有市场。今天之后,OpenAI用自己的内部标准,经由红队和外部专家双重验证,亲口说出了"无法排除"。
不是学术论文里的推演,不是末日论者的警告。是一家真正在造这些东西的公司,承认了那条线可能已经被碰到。
接下来的问题是:当这条线真的被越过,现有的规则、框架和安全协议,还够用吗?
OpenAI给出的答案是先关起来再说。但"关起来",从来都不是终点。
推荐飞总知识星球,在私域场合里畅所欲言,聊聊职场发展的事情,和飞总提问交流,这么低 的价格不会一直保留,机会难得,一定不要错过这个的机会。
热门跟贴