这个月初 OpenAI 发布了 GPT-6 Astra,称它是“世界上最聪明、对齐做得最好的模型”。能力很强,价格也不低:API 每百万 token 输入 10 美元、输出 50 美元。

今天,OpenAI 把 GPT-6 家族补齐了:中端的GPT-6 Sol,轻量的GPT-6 Luna。Astra 负责最难的任务,其他活交给更便宜的模型。

OpenAI CEO Sam Altman 在 X 上说,Sol 和 Luna 在智能、对齐、工作产出、编码和电脑操作等方面比 5.6 系列有重大改进,每 token 价格只有一半,每任务的价格还要更低。

打开网易新闻 查看精彩图片

▲ 图:Sam Altman 在 X 上介绍 GPT-6 Sol 和 Luna

发布时间也很巧。就在前一天(美国时间 9 月 22 日),Anthropic 发布了 Claude Opus 5.5,同样主打降价和提效。

01 价格:官方说降了一半,要看跟哪个价比

两款模型已经上线 API,名称分别是gpt-6-sol和gpt-6-luna。

每百万 token 价格如下:

打开网易新闻 查看精彩图片

▲ 图:GPT-6 Sol 和 Luna 与 GPT-5.6 同级模型的 API 价格对比

OpenAI 在 X 上的原话是,价格“比 GPT-5.6促销价低 50%”。

8 月下旬 OpenAI 给 GPT-5.6 Sol 做过三个月的限时降价,原价是输入 5 美元、输出 30 美元。按原价算,GPT-6 Sol 输入便宜了 60%,输出便宜了约三分之二。

这次的新价格不是限时的。

OpenAI 产品负责人 Tibo(Thibault Sottiaux)在 X 上说,API 价格是永久降低 50%。他还宣布给 Plus、Pro 和 Business 用户的账户发放一次“banked reset”,按字面意思,是存进账户、需要时再用的一次用量重置。

打开网易新闻 查看精彩图片

▲ 图:OpenAI 产品负责人 Tibo 在 X 上宣布永久降价和用量重置

放在 GPT-6 家族里看,Sol 的单价是 Astra 的五分之一,Luna 又是 Sol 的二十分之一。

和 Opus 5.5 比(输入 4 美元、输出 20 美元),Sol 的单价正好是它的一半。

02 Sol:定位专业工作,主要比成本

OpenAI 几乎每项基准测试都拿 Claude 来对比,比的不只是分数,还有每个任务的成本。以下是官方数据,Claude 的成绩取自公开报告。

最亮眼的是 AutomationBench(跨应用的商业工作流):Sol 在 xhigh 推理强度下得分 33.2%,单任务约 0.27 美元;Claude Opus 5 开到 max 是 26.9%,成本却是 Sol 的 11 倍多。

打开网易新闻 查看精彩图片

在 DeepSWE v1.1(真实代码库中的软件工程任务)上,Sol max 得分 68.8%,比 Claude Fable 5 的最高分低 1.1 个百分点;在 OSWorld 2.0 离线版(电脑操作)上,Sol 和 Claude Opus 5 medium 基本打平,60.5% 对 60.3%。两项的单任务成本都低约 80%。

打开网易新闻 查看精彩图片

要注意,这些成绩多是开到 xhigh 或 max 换来的,Sol 也没有全面领先,卖点是同等水平下便宜很多。

而且 OpenAI 对比的是 Opus 5,不是前一天刚发布、运行成本又降了 40% 的 Opus 5.5。

03 Luna:成本约百分之一,做到上一代中端的水平

Luna 的起点低,提升幅度比 Sol 还大。DeepSWE v1.1 上,Luna max 得分 66.6%,与 Claude Opus 5 和 Fable 5 在 medium 强度下相当;OSWorld 2.0 上,它超过了 GPT-5.6 Sol medium,成本只有后者的十分之一。

上一代要花中端模型的钱才能做的事,现在用轻量模型就能做到相近水平。批量处理、客服、数据清洗这类调用量大的场景,账单会有明显变化。

04 第三方评测:成本减半,分数基本持平

独立评测机构 Artificial Analysis 在发布当天给出了第一份第三方成绩。结论是:成本确实减半,但综合智能分数和 GPT-5.6 基本持平,有的项目进步,有的退步。

在它的 Intelligence Index 上,GPT-6 Sol (max) 跑完一轮任务要 1.06 美元,GPT-5.6 Sol (max) 要 1.99 美元;Luna (max) 是 0.07 美元,上一代是 0.18 美元。

省钱主要靠降价,新模型每个任务的输出 token 其实略多。

打开网易新闻 查看精彩图片

▲ 图:Artificial Analysis 智能指数排名(上),以及智能指数与单任务成本的关系(下)

分数上,Sol (max) 的智能指数是 48,上一代是 47;Luna (max) 和上一代都是 37。

同一榜单上,Claude Opus 5.5 以 58 分排第一。编码 Agent 方面,Sol 比上一代高 2 分,Luna 反而低了 2 分。

幻觉明显减少,但一部分是靠少答题换来的。

Sol (max) 的幻觉率从 92% 降到 60%,它只尝试回答 83% 的问题(上一代是 99%),准确率也从 59% 降到 54%。

知识工作类测试出现了退步。在 GDPval-AA v2.1(基于 OpenAI 的 44 个职业经济价值任务数据集改编)上,Sol 下降约 100 Elo 分,Luna 下降约 75 分。

打开网易新闻 查看精彩图片

▲ 图:GDPval-AA v2.1 排行榜,GPT-6 Sol 和 Luna 均低于各自的上一代

Artificial Analysis 人工检查了数百份模型输出,退步主要是因为交付物的呈现质量下降,以及遗漏了评分标准要求的内容。

05 缓存和说话方式

提示缓存也改进了:默认命中率更高,命中缓存的输入 token 只收原价的一成,缓存写入仍要多付 25%。OpenAI 还加了缓存仪表盘和诊断工具。GitHub 反馈,需要重新处理的提示 token 占比降了 50% 以上。

回答风格上,OpenAI 说新模型更清晰、更少术语,回答整体略短。巧的是,Anthropic 这次也说 Opus 5.5 的表达更自然。

两家同一周都在改“AI 腔”。

06 最早的上手反馈

最有分量的早期反馈来自 Every 创始人 Dan Shipper,他们在团队的真实工作里把 Sol 和 Opus 5.5 做了对比。

他的结论是:Sol 写作接近 Astra,干净简洁;电脑操作上,早期预览版在 6 个较简单任务的 18 次尝试中有 17 次达到 Astra 的水平;但在长时间自主编码上,Opus 5.5 的上限更高。他也吐槽 Codex 新的安全分类器会反复打断已经授权的工作。

总体上,他把 Sol 比作一次“S 版 iPhone 发布”:拿到 Astra 大部分的能力,价格只有五分之一。不过他也承认,Opus 5.5 是这一轮更大的惊喜。

评论区里,有人问为什么没有明显的分数飞跃;也有几位用户贴出报错,在 Codex 里用 ChatGPT 账户登录时提示不支持gpt-6-sol。OpenAI 说当天会逐步推送,这可能只是还没轮到。

07 谁能用

Sol 和 Luna 即日起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,当天内逐步推送。

打开网易新闻 查看精彩图片

免费和 Go 用户可以在桌面 App 中使用 Luna;API 已同步上线。ChatGPT 普通对话暂未开放,官方没有给出时间。

08 写在最后

把 Astra、Sol、Luna 放在一起看,OpenAI 的思路很清楚:旗舰模型负责拉高上限,中端和轻量模型负责把价格打下来。

但结论要分开看。

官方成绩是 OpenAI 自己测的,对比的是 Opus 5;第三方评测则显示,成本减半是真的,综合分数和上一代基本持平,知识工作类任务还有退步。

所以这一代更像是同样的能力变便宜了,而不是变强了很多。要在具体业务里换模型,最好先拿自己的任务测一轮。

参考资料

01|OpenAI:Introducing GPT-6 Sol and GPT-6 Luna

https://openai.com/index/introducing-gpt-6-sol-and-luna/

02|X:OpenAI 发布推文及回复

https://x.com/OpenAI/status/2102460975790137662

03|X:Artificial Analysis 对 GPT-6 Sol 和 Luna 的评测

https://x.com/ArtificialAnlys/status/2102462962758033624

04|Anthropic:Introducing Claude Opus 5.5

https://www.anthropic.com/claude-opus-5-5