今年6月底初次亮相就引爆全网的GPT-5.6,终于在万众期待中迎来全量开放。OpenAI一次性推出三款以天体命名的模型Sol、Terra、Luna,完整覆盖高端科研、日常办公、轻量化批量处理全场景。
这场发布会不止是单纯的模型更新,一边用实打实的测评数据对标竞品ClaudeFable5,打出腰斩级低价;一边打通ChatGPT与Codex两大产品,推出可自主完成完整项目的ChatGPTWork。更震撼的是,官方证实旗舰模型Sol能够独立完成轻量化模型Luna的整套后训练流程,AI自主研发AI的递归自我改进,从概念落地为现实。这场更新彻底改写大模型的性能、成本与产品形态,AI行业新一轮竞争正式拉开帷幕。
一、三档模型全覆盖,定价直接击穿行业成本底线
本次GPT-5.6系列分为太阳、大地、月亮三款定位清晰的模型,不同需求的开发者、企业和普通用户都能找到适配版本,最亮眼的莫过于大幅下调的API定价,对比竞品ClaudeFable5优势十分突出。
旗舰Sol(太阳)是整套系列的性能天花板,专攻复杂代码编写、网络安全、科研推演、长链路智能体任务,面向企业研发、算法团队、安全研究员等专业人群。单百万token输入5美元、输出30美元,刚好是ClaudeFable5定价的一半,后者输入10美元、输出50美元,成本差距一目了然。
均衡款Terra(大地)主打日常办公、中小型开发、文档处理,综合性能超越前代GPT-5.5,价格再度减半,输入2.5美元、输出15美元,中小企业批量使用也不会产生高额算力开销。
轻量化Luna(月亮)定位高吞吐、低门槛场景,内容审核、批量数据分类、简单问答都能胜任,定价仅1美元输入、6美元输出,成为普通开发者、个人创业者的首选。
整套产品线形成清晰梯度,高端任务选Sol,日常工作用Terra,大批量简单任务交给Luna,同水平性能下成本仅竞品的四分之一,彻底解决企业长期头疼的AI算力成本问题。
二、全维度测评反超竞品,编程能力刷新行业纪录
OpenAI本次放出多组权威第三方评测数据,Sol在多项硬核榜单上直接甩开ClaudeFable5,效率提升更是肉眼可见。
在衡量长期复杂工作流的Agents'LastExam测试中,Sol拿到53.6%的分数,领先Fable5足足13.1个百分点;考验命令行工程能力的Terminal-Bench2.1,标准版Sol得分88.8%,开启Ultra多智能体模式后冲到91.9%,而Fable5仅83.1%。
最受开发者关注的编程赛道,ArtificialAnalysis编程智能体指数里,Sol开满Max深度推理拿到80分,创下全新行业SOTA,比Fable5高出2.8分。更关键的是效率优势:完成同等代码任务,Sol消耗的输出token不到竞品一半,耗时缩短一半,整体使用成本降低三分之一。
整条产品线的性能都实现越级,Terra综合能力略高于Fable5,轻量版Luna直接超越ClaudeOpus4.8,两款中端、轻量化模型同样做到耗时减半、token消耗减半、成本压缩至四分之一。
除此之外,GPT-5.6补齐了此前视觉设计的短板,能够自主渲染页面、UI、三维模型,自动检查配色、布局、交互漏洞并迭代修改。发布会现场展示的航海小游戏、博物馆官网、室内设计方案,从草图到成品全程自主完成,审美与落地实用性大幅提升。
在电脑操作、网页检索场景,Sol同样刷新纪录:网页深度检索BrowseComp得分92.2%,模拟完整电脑操作的OSWorld2.0拿到62.6%,超越Opus4.8的同时,输出token直接减少85%,为后续自主办公智能体打下坚实基础。
三、Max+Ultra双推理模式,多智能体并行加速复杂任务
为应对大型项目、多步骤长流程工作,GPT-5.6新增两档高阶推理设置,按需调配算力,兼顾完成质量与速度。
Max模式会给模型预留更长思考时间,反复推演方案、排查漏洞、优化逻辑,适合严谨的代码开发、学术论文、安全渗透等高精度需求。
Ultra模式是本次更新的核心亮点,默认同时调度4个智能体并行处理任务,极端复杂工程可扩容至16个智能体协同工作。多智能体分工拆解目标、分头执行、交叉校验结果,在网页检索、财报分析、命令行工程三类测试中,实现分数更高、耗时更短的双重提升。
以往需要几小时逐步骤推进的大型项目,开启Ultra模式后能够同步推进多个分支工作,大幅压缩交付周期。不过该模式token消耗速度更快,更适合企业Pro、企业版用户处理重度工作。
四、ChatGPT与Codex合体,ChatGPTWork全能办公智能体上线
模型之外,OpenAI完成产品体系的重大整合,独立多年的Codex编程应用正式并入ChatGPT桌面端,用户无需切换软件,在同一个客户端就能完成聊天、写代码、项目统筹全流程操作。
新版桌面端搭载内置浏览器与ComputerUse电脑操控功能,AI可直接读取本地文件、操控软件、点击页面、批量整理文档,打通线上网页与本地电脑的操作壁垒。配套推出的ChatGPTWork,对标ClaudeCowork,是一款能长期驻场执行项目的全能智能体。
它不再只输出零散文字代码,而是完整拆解工作目标,跨网盘、邮箱、办公软件调取资料,连续数小时跟进项目,最终交付可直接使用的表格、PPT、网页原型、完整程序。用户在手机端就能远程下发任务,即便不在电脑旁,AI也能持续推进工作进度,自动化处理周报汇总、客户跟进、项目复盘等重复性办公事务。
至此ChatGPT形成统一超级应用,聊天对话、代码开发、自主办公三大功能全部整合,个人、小型团队无需同时安装多款工具,一套软件覆盖绝大多数AI使用场景。
五、真正的AI永动机:Sol自主训练Luna,递归自我改进落地
整场发布会最具颠覆性的内容,并非亮眼的测评与低价,而是AI自主迭代的现实案例。官方披露,轻量化模型Luna整套后训练流程,全部由旗舰Sol独立完成。
只需要输入基础需求,Sol就能自主筛选训练参数、调配GPU资源、启动训练脚本、排查运行故障,从模型调试到最终验收一站式搞定,这套工作过去需要一整支资深研究员团队耗时数周完成。
内部递归自我改进(RSI)评测数据显示,Sol相比上一代GPT-5.5提升16.2分。内测期间,OpenAI研究员依靠GPT-5.6处理实验、调试训练系统、分析数据,人均日均token使用量达到前代两倍以上。过去半年,公司投入内部AI研发的算力暴涨100倍,内部智能体token用量增长22倍,AI已经成为加速自身迭代的核心工具。
简单来说,AI正在自主制造更强的AI,研发速度不再完全受人类研究员效率限制,行业迭代节奏会持续加快。这种自我进化的闭环,也是业内从业者感到震撼的核心原因,大模型的发展速度或将迎来指数级提速。
从性能全面反超竞品、价格大幅下探,到产品一体化整合,再到AI自主训练模型的技术突破,GPT-5.6的发布不止是一次常规版本更新。OpenAI同时攥住性能、成本、产品生态、自我进化四大优势,直接搅动整个前沿大模型赛道。
此前Claude依靠Fable5占据高端编程市场,但高昂定价成为明显短板;如今GPT-5.6以更低成本、更强综合能力完成追赶反超。而AI自主迭代带来的连锁效应,更会持续改变科研、开发、办公的底层逻辑。当AI能够独立完成下一代模型的研发,行业竞争的终点线将不断前移,接下来各大厂商的技术比拼,只会更加激烈。
热门跟贴