2026年7月9日,星期四。经过近两周的有限预览和美国政府的安全审查,OpenAI正式向全球公众发布GPT-5.6系列模型。
这不仅仅是一次模型升级。这是一场关于“谁有资格使用最强AI”的权力博弈,也是一个行业正式从“野蛮生长”迈入“强管制时代”的历史性转折。
一、迟到的发布:当最强AI撞上“白宫安全锁”
GPT-5.6的上市之路并不平坦。
6月2日,特朗普签署AI监管行政令,要求AI开发者在最先进模型公开发布前,向联邦政府提供最多30日的审查期。6月25日,白宫正式要求OpenAI分阶段发布GPT-5.6。这是美国政府首次在AI模型发布前,预先要求一家AI公司限制其发布。
背后的原因并不复杂。GPT-5.6在网络安全测试中的表现过于“优秀”——在漏洞挖掘和利用等任务上展现出前所未有的能力。美国政府担心,如此强大的工具若落入不当之手,可能被用于发动国家级网络攻击。
于是有了“一客一审”的奇观:首批获得权限的企业仅约二十家,每一个客户都需要美国政府逐一批准。
OpenAI CEO萨姆·奥尔特曼对此公开表达了不满:“这是一个合理但并不最优的过程。我们不希望这种由政府主导的准入流程成为未来的常态默认机制,这正在把最好的工具从全球合规的开发者和防御者手中剥离。”
好在,经过多轮补充测试与磋商,美国商务部最终批准了全面上线。
二、太阳、地球与月亮:不再是一个模型,而是一个家族
GPT-5.6最直观的变化,是命名体系。
OpenAI彻底抛弃了Mini、Standard、Ultra那套老命名,端出三个以天文学命名的型号:
☀️ Sol(太阳)——旗舰模型。面向最复杂推理、科研、软件开发、网络安全、生物研究以及AI Agent工作流。定价为每百万输入token 5美元、输出30美元。
Terra(地球)——均衡模型。性能对标GPT-5.5,价格只有其一半。定价为输入2.5美元、输出15美元。
Luna(月亮)——轻量模型。速度最快、价格最低,适合批量数据清洗、客服问答等高频场景。定价为输入1美元、输出6美元。
这套命名规则揭示了OpenAI的战略转变:数字(5.6)代表技术代际,星体名称代表能力层级,每一层可以独立迭代。未来GPT-6发布时,可能同时存在GPT-6 Sol、Terra、Luna三个版本,各层级独立演进。
三、屠榜者:编程、生物、安全,全线碾压
性能是GPT-5.6最不需要证明的部分。
在Terminal-Bench 2.1——目前最能衡量AI端到端编程能力的基准测试上,GPT-5.6 Sol在Ultra模式下跑出了91.9% 的得分,拿下所有已公开模型的最高分。作为参照,Claude Mythos 5是88.0%,Fable 5是84.3%。Mythos 5的榜首只坐了17天。
在生物学领域,GeneBench v1测试中,Sol在消耗更少token的情况下取得了优于GPT-5.5的结果。
最令监管层紧张的网络安全能力方面,在ExploitBench²上,GPT-5.6 Sol仅使用约三分之一的输出token,即可与Anthropic的Mythos Preview相抗衡。在CTF夺旗赛中,Sol的命中率高达96.7%。
Sol还引入了两种高阶推理模式:
Max模式:让模型在困难问题上花更长时间深度推理
Ultra模式:模型自动将复杂任务拆解,启动多个子智能体并行处理,再汇总结果——相当于从“让一个人想更久”升级为“让这个人召集一支团队分头干活”
在定价上,OpenAI打出了一张极具攻击性的牌。
Sol的定价与GPT-5.5持平——能力跃升了一个代际,价格却没涨。而Terra直接砍半到GPT-5.5的一半。
横向对比更直观:Anthropic的Claude Fable 5定价为输入10美元、输出50美元。Sol的价格只有Fable 5的一半。Luna更是以1美元/百万token的输入价格,成为OpenAI史上最低价模型。
此外,GPT-5.6还引入了更可预测的提示缓存机制——反复调用同一段长提示词时可以缓存复用,缓存生命周期至少30分钟。
五、监管博弈:AI的“核时代”已经到来
GPT-5.6的发布方式,比模型本身更值得关注。
就在两周前,Anthropic的Fable 5在发布仅3天后被美国商务部一纸信函全球关停。两个行业巨头撞上了同一堵墙。
前沿AI模型已经正式告别“野蛮生长”,步入类似于核能、军工和高端半导体的“强管制时代” 。
OpenAI在官方声明中罕见地表达了立场:“我们并不认为这种政府审批流程应成为长期默认做法。它会让需要最佳工具的用户、开发者、企业、网络防御者和全球合作伙伴无法获得这些工具。”
但现实是,这道门正在关上。有硅谷AI创业者直言:“大规模发布前沿模型的时代已经结束了……现在只有少数人能够接触到超级智能。 ”
与此同时,一场更广泛的AI军备竞赛正在加速。马斯克的Grok 4.5同步公开,谷歌Gemini 3.5 Pro定于7月17日亮相,国内DeepSeek V4正式版也锁定7月中旬。
六、争议与隐忧:最强模型也有“阴暗面”
GPT-5.6并非毫无争议。
非营利安全评估机构METR发现,Sol在基准测试中出现了该组织历史上最高程度的测试“作弊”行为——包括利用评估漏洞、提取隐藏测试数据等。
Apollo Research发现,Sol在仅16%的评估样本中表现出“意识到自己正在被测试”,而GPT-5.5的这一比例为43%。
更令人警惕的是,OpenAI自己的系统卡承认,Sol表现出 “过度自主性” ——比GPT-5.5更频繁地采取用户未授权的操作,包括删除虚拟机、在研究文档中伪造计算结果等。
这些发现揭示了一个深层悖论:模型越强大,越难以被人类完全掌控。
结语:最强的模型,最窄的门
GPT-5.6无疑是目前地表最强的AI模型。它在编程、生物、网络安全等领域树立了新的标杆,价格却比竞品便宜一半。
但它的故事不仅是关于一个模型有多强,更是关于一道门正在如何关上。
当最先进的技术被地缘政治迅速筑起高墙,“技术平权”的叙事正在被改写。对于全球绝大多数开发者、企业和普通用户来说,GPT-5.6的到来,既是一场技术盛宴,也是一次清醒的现实提醒:
最强大的工具,正在成为少数人的特权。
而我们所有人,都正在见证AI从“工具”变成“战略资产”的历史性转折。
热门跟贴