刚刚,OpenAI正式发布了GPT-6,代号Astra。目前还没有对公众开放。

OpenAI给它的定位特别牛逼:世界上最智能、最对齐的模型,能直接操作电脑、浏览器和专业软件,把一整套工作从头干到尾。

但在Artificial Analysis的榜单里,Astra却不敌Fable 5.1,甚至比不上Opus 5。在综合9项知识、编程、工具调用和长上下文的测试里,Astra最高61分,与GPT-5.6 Sol持平,比Fable 5.1的66分少5分。

打开网易新闻 查看精彩图片

在Coding Agent Index里,Astra拿到67分,比Sol高2分,但还是低于Claude Fable 5.1的70分;不过完成这些编程任务时,它的token用量只有Sol的约三分之一。

Astra没有坐上综合榜第一,但在操作电脑、调用工具,连续任务完成能力上却得到了不小的提升。

打开网易新闻 查看精彩图片

01 它是最强,但得加一个主语

在OpenAI自己的模型里,Astra就是最强。

打开网易新闻 查看精彩图片

根据OpenAI公布的数据,Astra几乎全面领先。

但提升最大的,还得是电脑操作和多步任务。

OpenAI公布的OSWorld 2.0电脑操作测试里,Astra得分72.6%,GPT-5.6 Sol是65.7%,Claude Opus 5是70.2%。同一组延迟模拟里,Astra完成一项任务约40分钟,Sol要75分钟,时间少了47%

多步自动化工作测试中,Astra从Sol的18.1%冲到41.4%,也高于Fable 5.1的31.4%。科学工作流的测试中,Astra是64.6%,Sol只有22.4%

数学成绩更夸张。FrontierMath Tier 4里,Astra是97.6%,Sol是80.5%。可在带工具的测试上,Astra只有57.2%,Claude Fable 5.1是65.0%。

所以,Astra只能说是当前最强的「干活模型」,还不是所有综合考试都能通杀的榜一。

打开网易新闻 查看精彩图片

这些数字主要来自OpenAI自测。官方也写明了,测试在研究环境或API中运行,系统提示词和可用工具不同,实际体验可能完全是另一回事。

等我们的测试吧。

02 AGI前奏,凭什么敢说

在记者会上,OpenAI的总裁格雷格布鲁克曼(Greg Brockman)说:如果几年后回望「AGI到底是什么时候被造出来的」,我觉得就是现在,可能就是这个模型。

在介绍推文中,OpenAI也说:Welcome to the AGI era。

AGI真的就这么就来了?OpenAI凭什么敢这么说?

最直接的原因就是,AI可以像人一样使用电脑了。

Astra能直接打开软件进行操作。OpenAI展示的任务从填美国税表、整理法律文件,一路跨到设计电路板和制作3D游戏。

打开网易新闻 查看精彩图片

对Agent来说,这等于终于长出一双能真正干活的手。

第二个,很长的任务做到一半,Astra不容易忘记自己在干什么。

Astra有1.05M上下文。在Codex里,它还能跨上下文窗口保存笔记,搜索早先的消息和工具结果,不过这项能力目前仍是实验功能。

打开网易新闻 查看精彩图片

API新增的异步工具调用,还允许它等一个工具时先做别的部分;用户中途改要求,它也能接着原任务转向。

第三,AI开始做出了训练资料里没有的新发现。

OpenAI公布,Astra参与把无穷多素数对的已知间距上界推进到186,还改进了一项80多年没变的大素数间隔结果。在一组知识截止日之后的网络安全测试里,它还发现并利用了两个此前未知的零日漏洞。

这也是Astra成为OpenAI首个达到「Critical」网络安全能力阈值模型的原因。普通用户拿到的版本会拒绝生成高级漏洞利用程序,不等于大家明天就能用ChatGPT去打网络战。

打开网易新闻 查看精彩图片

03 AGI真来了吗

OpenAI章程对AGI的定义,是「在大多数具有经济价值的工作上超过人类的高度自主系统」。也就是说,同一套AI要能自己学、自己规划、自己操作,还得在大多数真实工作里比人做得好。

互联网上被转发最多的证据是ARC-AGI-3的99.9%

这套测试不会直接告诉AI目标,它要自己探索陌生环境、推测规则、制定计划。在模型厂商专用的Provider Adapter运行系统下,Astra最高得分99.9%;换成ARC Prize的标准统一系统,最高是62.7%。

打开网易新闻 查看精彩图片

ARC Prize自己也明确表示,跑满这项基准不代表「证明实现AGI」。它的范围仍然很窄,环境是确定的,目标也是封闭的,离真实世界的混乱还有一大截。

当然价格也很离谱。

API标准价是每百万token输入10美元、缓存读取1美元、缓存写入12.5美元、输出50美元,单价是Sol的2.5倍。整体和Fable 5.1一个水平。

而且要注意,输入一旦超过27.2万个token,整次请求的输入和缓存价格翻倍,输出价乘1.5。

打开网易新闻 查看精彩图片

Artificial Analysis实测的综合任务成本仍比Sol高75%。编程任务因为token用量少了约70%,账单差距会小一些。

目前,Astra已经开放给OpenAI Trusted Access Program里的少量机构,普通用户还要等几天。

OpenAI说,API和ChatGPT Plus、Pro、Business、Enterprise会在接下来几天陆续上线,免费用户不在首轮名单。

昨天晚上还发生了另一件事,ChatGPT和Codex、Claude、Grok出现了罕见的重叠故障,几乎所有主流模型都无法访问。

打开网易新闻 查看精彩图片

有人在X上直接问OpenAI:是不是你们把这头猛兽放出来了?

总之在一阵手忙脚乱之后,自称为AGI开端的GPT-6 Astra就这么来了。

多年以后,面对真正的AGI,我们是不是会回想起GPT-6 Astra发布的那个晚上?

来源 | 硬核看板(ID:yinghekb)

作者 | 李沣; 编辑 | 呼呼大睡

内容仅代表作者独立观点,不代表早读课立场