9月3日晚间,全球AI服务经历了一场大宕机。就在众人准备休息时,9月4日凌晨三点半,OpenAI发布了GPT-6 Astra。9月5日,该模型已全量推送,付费用户可及时体验。
“欢迎来到AGI时代。”OpenAI总裁Greg Brockman在介绍GPT-6 Astra时如此表示。与前几代大模型相比,新模型在多个关键基准上跑出了“饱和”成绩,将编程、长程任务的能力向上提升了一截。
但“会刷题”算不得什么,能干活才真有用。实际干活时,GPT-6 Astra能做到“又快又省”——交付质量更高的同时,单次任务的Token消耗和任务耗时都明显低于上一代。Perplexity在自家AI研究智能体评估框架中甚至测出,Astra的单次任务花销低于Fable 5.1。
发布不到一周,Anthropic的新模型Fable 5.1就被GPT-6 Astra抢去了风头。现场演示和网友实测里,各种复杂的活儿都被丢给了它:操作电脑、填表单、建网站,甚至把电子原理图排成可投产的PCB、在Blender里建好房间模型,再转进虚幻引擎,让用户可以在建模场景中走动查看房屋细节。
支撑这一跃迁的,是又一次“大力出奇迹”:据外媒报道,GPT-6 Astra的训练动用了10万GPU的集群,是OpenAI迄今最大规模的一次训练。
性能“饱和”的GPT-6 Astra,成色几何?
这次GPT-6 Astra没有“见光死”,实际体验和演示效果差距不大。具体到能力表现层面,GPT-6 Astra在一些特定领域跑出了接近满分的极限分数。
比如,它在研究级数学基准FrontierMath Tier 4跑到98,官方形容为“饱和”;在强调陌生环境中学习与抽象推理的ARC-AGI-3上,GPT-6 Astra从上一代GPT-5.6 Sol的7.8%直接跳到99.9%;漏洞利用测试ExploitBench则直接满分100%,GPT-5.6 Sol为78.5%。
最夸张的是ARC-AGI-3,它相当于把大模型扔进一个陌生环境,不给规则说明,看它能不能自己摸索规则并做出正确决策。这个测试对人类来说并不难,但AI之前一直徘徊在不及格的区间。
不过,这个99.9%的高分有个前提:它跑在OpenAI为自家模型适配的Harness上,所以效果会更突出。但这并不意味着去掉Harness就立刻“拉胯”。根据ARC Prize发布的测评结果是62.7%,这已经是第二名Claude Opus 5的两倍。
厂商自报分数用自家框架,确实是常规操作:DeepSeek上月底发布的DeepSeek V4 Flash,官方在注释里写明基于自家DeepSeek Harness测得,它还同步把Harness作为独立产品推向市场。所以这并不是问题。
不过,GPT-6 Astra的提升也有些许“偏科”。从OpenAI给出的成绩来看,它在部分任务上出现了“倒退”的情况。以测评模型Agent能力的指标之一——人类终极测试(Humanity’s Last Exam)上,GPT-6 Astra的成绩为57.2%,反而低于GPT-5.6 Sol与Fable 5.1。
这样的偏科成绩,也让测评机构给出了不一样的评估分数。比如按照Artificial Analysis的通用智能指数,Astra为61.2,与Sol的60.9基本持平,导致新模型也被不少网友戏称是“更贵版本的Sol”。但实际上,AA测评的指标更多集中在知识、推理等能力上,GPT-6 Astra的强项多数不在它的测评范围内。
热门跟贴