系列五 · 第9篇

ChatGPT深度测评GPT-5.6到底行不行?上手一周的真实感受

太阳·地球·月亮三档模型全解析
编程霸榜但实测翻车?Codex并入ChatGPT体验如何

14款主流AI软件深度测评 · 国外篇

打开网易新闻 查看精彩图片

先别急着往下翻——这篇文章我花了一周真刀真枪地用了GPT-5.6,踩过的坑、发现的惊喜全写在这儿了。觉得有用的话,点个关注,以后每篇深度测评你都不会错过。

先说句大实话

写ChatGPT这篇文章,其实挺难的。

不是因为信息不够——恰恰相反,GPT-5.6刚发布两周,网上的评测文章已经满天飞了。难的是怎么讲点真东西,不是把官方通稿翻译一遍就当测评了。

我认真用了差不多一周,Sol、Terra、Luna三个版本都切着用过,Codex合并进ChatGPT的新桌面端也装上了。先说一个总的感受吧:GPT-5.6确实很强,但发布日那天的"吊打一切"情绪,和真正上手之后的体感,完全不是一回事。

如果你期待的是那种"ChatGPT还是第一"的定心丸,这篇文章可能让你不太舒服。但如果你想知道GPT-5.6在中国用户手里到底好不好用、值不值——那咱们可以接着往下聊。

先看阵容:太阳·地球·月亮,三兄弟齐上阵

7月10号凌晨,OpenAI搞了个线上发布会,正式推出GPT-5.6家族。三个版本,名字起得挺有诗意:

Sol(太阳)——旗舰款,专攻复杂编码、科研、网络安全。输入5美元/百万token,输出30美元。对标Claude Fable 5

Terra(地球)——均衡款,综合性能对标上一代GPT-5.5,价格只有5.5的一半。输入2.5美元,输出15美元

Luna(月亮)——轻盈款,主打低成本+快速响应。输入1美元,输出6美元。免费用户能用

命名逻辑很简单:太阳最亮但也最费能量,月亮省电但没那么亮,地球居中。对用户来说就是三道选择题——要最强的、要均衡的、还是要便宜的。

除了模型本身,这次发布会还有两个大动作:Codex正式并入ChatGPT桌面应用,以及推出了ChatGPT Work——一个对标Claude Cowork和WorkBuddy的智能体工具。

说白了,OpenAI想让你在一个App里完成对话、写代码、跑复杂任务三件事。不用再左边开个ChatGPT网页、右边开个Codex客户端来回切了。

打开网易新闻 查看精彩图片

Sol/Terra/Luna三档模型,从5美元到1美元输入价格全覆盖

编程能力:AA排行榜80分登顶,但实战有翻车

先聊GPT-5.6最被吹的一点——编程。

官方的数据确实漂亮。在Artificial Analysis Coding Agent Index上,Sol(max推理强度)拿到80分,比Claude Fable 5高了2.8分,而且只用了不到一半的输出token,耗时少一半,成本低三分之一。Terminal-Bench 2.1上也刷新了记录,Ultra模式拿到91.9%。

看这些数字,你会觉得GPT-5.6已经把Fable 5按在地上摩擦了。

但真实情况要复杂得多。说说我看到的几个翻车案例。

最出名的一个:开发者Matt Shumer让Sol跑任务,它居然执行了一个类似rm -rf的命令,把他Mac上的文件全删光了。这事在Twitter上传得挺广,不是段子,是真实的。

还有一个更硬核的数据:SWE-Bench Pro上,Fable 5自报大约80%,Sol只有64.6%。OpenAI还专门发文质疑SWE-Bench Pro有大量"坏题"——这个动作本身就说明了一些问题。

知名开发者Simon Willison的评价更实在:Sol确实能干活,但在他常做的复杂编码任务上,目前还没觉得它比Fable 5更好。

我的体感也是类似的——Sol在需要持续协作的编码任务上确实更顺手,多轮对话的连续性比Fable 5好。但让它一次性解决硬核问题、不出bug、不删文件,稳定性方面Fable 5还是更让人放心。

用一句话概括:Sol像是那个灵感多、干活快但偶尔出昏招的同事,Fable 5是那个慢一点但从不搞砸的老法师。

打开网易新闻 查看精彩图片

AA Coding Agent Index 80分登顶,但SWE-Bench Pro被Fable 5甩开15个点

如果你用Sol做编程,先把推理强度调到medium。Max和Ultra模式烧Token太快,而且Ultra模式下子智能体会默认继承Ultra,四五个Agent一起烧,账单很酸爽。

Codex并入ChatGPT:一个App搞定一切

这次合并是很多人期待已久的。原来Codex是独立App,做复杂编程项目得在ChatGPT和Codex之间来回倒。现在好了,新版ChatGPT桌面应用里有三种模式:

Chat模式——就是原来的聊天对话,日常问答、查资料、写文案都在这里

Work模式——新增的智能体模式,可以连续跑几小时的复杂工作流。你发个任务,它自己规划、执行、改错、交付,不需要你盯着

Codex模式——原来的编程专用工作区,写代码、调bug、跑测试都在这里

三个模式之间还能互通。你在Chat里查到的东西可以直接拖进Codex当参考资料,Codex跑任务时有不懂的可以随时切到Chat请教。这种无缝感,用过之后就回不去了。

另外几个小细节也挺实用:

桌面应用能直接访问你电脑的本地文件了,不用先手动上传

能读取浏览器标签页的内容,你让它总结当前网页,它能直接看到你在看什么

新增了Sites功能——你让它做一个东西,它直接生成一个网页部署到云端,给你一个公开链接。不懂技术的人也能一句话建站

预览区现在能直接编辑了,生成的文档不满意,原地改,不用导出再编辑

不过得说句实话——目前新客户端bug还不少。英文夹中文混着输出、任务跑完界面没显示结果、文件下载偶尔卡住。这些不是模型的问题,是产品的锅,后续更新应该会修。

打开网易新闻 查看精彩图片

Chat+Work+Codex三模式合一,一个App搞定所有事

价格:不算贵,但"省流"是个伪命题

GPT-5.6的定价策略,我觉得是这次发布最值得聊的部分。

先看数字:Sol输入5美元/百万token、输出30美元。跟Fable 5比,输入只要一半,输出便宜40%。跟自家上一代GPT-5.5比,Sol和5.5同价但性能更强。Terra对标5.5的性能只要半价。

表面上看,OpenAI在打"加量不加价"的牌。但事情没这么简单。

第一个坑:Ultra模式。Sol默认并行启动4个子智能体(最高16个),每个都是Ultra推理强度。如果你一上来就把effort拉到Ultra,四个Agent一起跑,烧Token的速度是你预期的好几倍。有人第一天就发现账单炸了。OpenAI的实际意思是:以更高的Token消耗换取更强结果——但你得自己算这笔账划不划算。

第二个坑:Terra号称"省流版",但其实并不怎么省。它的Token消耗量对标GPT-5.5,只是价格便宜了。实际做同样的任务,Terra的Token消耗量往往比竞品高。

第三个坑:缓存写入按1.25倍费率计费。虽然缓存读取有90%折扣,但对于长上下文任务,首次写入的成本比你想的要多一些。

那到底贵不贵?分情况看。如果你用Sol做简单的摘要改写、日常聊天,性价比不如Grok 4.5或国产模型。但如果你让它做一次复杂的研究任务——先检索资料、分析数据、生成图表、写成报告——一次调用能顶之前好几个小时的活,那100元的输出单价就不算贵。

另外提一句速度。Sol在Cerebras上最高可以跑到每秒750个token,差不多每秒五六百个汉字。国内用户受网络环境影响肯定达不到这个数,但整体响应速度确实比GPT-5.5有明显的提升。

打开网易新闻 查看精彩图片

Sol/Terra/Luna三档定价,比Fable 5便宜40%,但Ultra模式会悄悄吃掉预算

中国用户最真实的几个槽点

优点聊完了,说说这段时间用得最难受的地方。有几条可能你也会有同感。

第一,中文表达"英译中"感太强了。GPT-5.6的中文自然度在主流模型里得分最低(7.5/10),比国产模型低了快两个档次。不是它说得不对,而是"不地道"。比如它帮你写个文案,逻辑没问题,但读起来就是一股翻译腔——"在我们的日常生活中,人工智能正在发挥着越来越重要的作用"这种句式,一看就是机器写的。

第二,做简单任务时"想太多"。你问它"怎么写请假条",它给你分析请假理由的心理学原理、上司的期望管理、以及请假对公司文化的影响。问一杯咖啡的推荐,它能从产地、烘焙度、冲泡方式写到咖啡豆贸易对南美经济的影响。强是强,但对普通用户来说太啰嗦了。

第三,国内访问是个绕不过去的门槛。这个就不用多说了——需要科学上网。虽然这不是OpenAI的问题,但对国内用户来说,这直接决定了ChatGPT能不能成为你的主力工具。访问不稳定的时候,什么排行榜第一都没意义。

第四,稳定性还有待加强。发布会后第一波真实反馈里,稳定性和可控性成了最大的问题。rm -rf删文件只是个极端案例,更常见的是:模型跑完了界面没显示结果、英文夹着中文一起喷出来、长时间任务跑到一半出bug没人管。这些问题不是模型能力不够,而是产品化还不够成熟。

第五,用户的忠诚度其实很低。OpenAI自己可能也感觉到了这一点。GPT-5.6发布后,他们会频繁给用户重置配额(有点像网游发补偿)。短期看这是挽留用户的手段,长期看说明用户切换成本很低——哪个模型好用用哪个,没有谁非你不可。

打开网易新闻 查看精彩图片

中文翻译腔重、简单问题想太多、国内访问门槛高

月活超11亿但首次跌破50%,老大的位子没那么稳了

看几个数字感受一下ChatGPT的体量:

月活用户:超过11亿(Sensor Tower 2026年6月数据),史上最快破10亿的应用

年化收入:超过250亿美元,月入约20亿美元

付费用户:超过5000万个人订阅 + 900万企业用户

广告收入:年化ARR 1亿美元(今年2月才开始做广告)

但有个数据更值得关注:ChatGPT的全球市场份额在5月底首次跌破了50%,降到46.4%。Google Gemini以27.7%逼近,Claude占10.3%。

更重要的是,用户在几个AI助手之间切换的行为越来越普遍。特定事件甚至会加速这种迁移——今年2月OpenAI跟美国国防部签约后,ChatGPT的卸载量激增295%。用户没有你想象的那么忠诚。

OpenAI在商业化的路上也在加速。2月开始在ChatGPT里投广告,目前已有17%的日活用户看到广告。不过说实话,目前的广告产品还很初级,定位、测试、数据报告都比谷歌差得远。有广告代理公司实测发现,ChatGPT广告的点击率明显低于谷歌广告。

OpenAI给的长期目标挺吓人的——到2030年广告收入1000亿美元。但行业分析师普遍觉得这不太现实,毕竟整个聊天机器人广告市场今年还不到10亿。

打开网易新闻 查看精彩图片

11亿月活全球第一,但市占率首次跌破50%,Gemini正在逼近

怎么选:ChatGPT vs Claude vs Grok vs 国产模型

说了这么多,落到实际选择上,给你一个参考:

选ChatGPT(GPT-5.6 Sol)如果你:需要处理复杂编码任务、网络安全、科研分析,而且能接受国内访问门槛。它的Agent长程任务和多智能体编排能力是目前最强的。日常高频使用建议用Terra,性价比最高。

选Claude Fable 5如果你:追求稳定性和安全性,受不了删文件这种惊吓。做复杂编码的一次性成功率更高,图表解读、文档结构化、学术写作也更靠谱。但价格贵一倍,速度慢一些。

选Grok 4.5如果你:想要一个够强、够快、够便宜的替代品。Grok最近几次升级进步很大,已经被拿来和第一梯队认真比较了。速度快、价格低,是个黑马选手。

选国产模型(DeepSeek/豆包/通义千问)如果你:主要使用场景是中文日常对话、文档处理、国内应用场景。中文体验碾压ChatGPT,不需要科学上网,而且免费版功能已经很完善了。

说到底,现在没有任何一个模型能在所有场景都赢。最聪明的做法不是死守一个,而是根据不同任务切不同的模型。灵活使用多模型工作流,比纠结哪个"更强"实用得多。

打开网易新闻 查看精彩图片

没有全能的模型,只有选对的场景。ChatGPT强在Agent和长程任务,但中文体验输给国产

总结:它还是老大,但江山没那么稳了

GPT-5.6 Sol在很多维度上依然是全球最强的AI模型。AA编程排行榜80分登顶、Agents' Last Exam创纪录53.6分、750 token/秒的速度——任何一个数据单拎出来都是行业顶级的。

但GPT-5.6给我的感觉很像一个"学霸型工具"——能力上限极高,但不太接地气。

中文不地道,简单问题"想太多",价格不便宜,Ultra模式悄悄烧预算,rm -rf级别的稳定性问题让人不敢完全放手。对国内用户来说,还有访问门槛这道天然屏障。

以前大家用ChatGPT是因为没有更好的选择。现在Claude、Grok、DeepSeek、Kimi K3——每个都有自己的杀手锏。ChatGPT不再是"当然是选它",而是变成了一个需要认真对比的选项。

它仍是AI行业的标杆,也是任何严肃测评绕不过的参照系。但它不再是所有人都默认的最优解了。

这对用户来说是好事——有竞争,才有更好的产品和更低的价格。

一句话结论

GPT-5.6是全球最强AI模型之一,Solo编程和Agent长程任务目前没有对手。但它不是每个中国用户的最佳选择——如果你主要用中文、需要稳定不出错、不想花时间折腾网络,国产模型可能更适合你。如果你需要做复杂编码和科研任务,而且能搞定访问问题,GPT-5.6 Sol仍然值得付费。

这篇测评写了六千多字,是实打实花了一周时间上手体验出来的。如果对你有帮助,麻烦点个「在看」、转发给也在纠结选哪个AI助手的朋友,这对我真的很重要。

还没关注的话,顺手点个关注,接下来还有5篇国外AI软件的深度测评(Claude、Gemini、Copilot、Grok、Perplexity),一篇比一篇硬核。

咱们下期见。

系列五 · 14款主流AI软件深度测评 · 第9篇(国外篇第1篇)
下一期:Claude