GPT-6 Astra 发布了

当地时间 9 月 3 号,GPT-6 Astra 正式发布。发布会最后,总裁 Greg Brockman 站在台上,就甩了一句话:

"Welcome to the AGI era."

不是那种"参数翻倍、跑分刷榜"的常规升级。这次 GPT-6 Astra 干了一件以前所有模型都没真正干成的事:

它不再只是"回答你的问题",而是真的在"帮你把活干完"。

这俩的区别,天差地别。

 一、先说参数,30 秒过完
打开网易新闻 查看精彩图片
一、先说参数,30 秒过完

老规矩,硬件指标先摆这儿:

  • 上下文窗口 :105 万 Token

  • 最大输出 :12.8 万 Token

  • 知识截止 :2026 年 4 月底

  • API 定价 :输入 百 万 , 输 出 50/百万 Token(上一代 Sol 的 2.5 倍,跟两天前 Claude Fable 5.1 一个价)

目前先给少量机构用,ChatGPT Plus、Pro、Business、Enterprise 用户等几天灰度推送。

Plus 用户别急着升 Pro,Astra 本身就在 Plus 的覆盖范围内,等推送就行。

但说真的,这些数字只是开胃菜。

二、最大杀器:它真的会"用电脑"了

这次最核心的升级,四个字:Computer Use

OpenAI 直接喊出"世界上最好的电脑操作模型"。

你可能会说,这不就是自动化脚本吗?不是。

以前让 AI 操作软件,要么走 API,要么上 MCP 协议。但现实是什么?你公司那个跑了十五年的内部系统,连文档都没有,API?不存在的。

Astra 的思路特别粗暴,也特别聪明:

你不给我接口是吧?行,我直接看屏幕、找按钮、点鼠标、填内容。跟人一样用电脑。

打开网易新闻 查看精彩图片

你想想,屏幕和键鼠,才是这个世界上最通用的"API"。

官方演示里它干了啥?我列一下你感受一下:

  • • 在 KiCad 里画 PCB 电路板

  • • 用 Excel + Power BI 做财务报表

  • • 填美国 1040 报税表

  • • 给法律文件排版

  • • 在 Blender 里建一栋房子,然后丢进 Unreal Engine 5 变成能走进去逛的 3D 场景

  • • 搭完网站,自己跑一遍前端 QA

这些软件之间八竿子打不着,但 Astra 全用同一套"看屏幕干活"的逻辑搞定了。

实测数据更离谱:

测试项

Astra

上代 Sol

OSWorld 2.0(电脑操作)

72.6%

65.7%

单任务平均耗时

40 分钟

75 分钟

AutomationBench(办公自动化)

41.4%

18.1%

最直观的一个例子:帮你在网上找一个合适的儿科医生。Astra 用了 2 分 54 秒。人类平均要花 5 个小时

这不是"辅助",这是"替代"。

三、跑分环节:三个数字说明一切

我知道你们爱看跑分,来,三个最炸的:

① ARC-AGI-3:99.9%

这个测试是啥?把 AI 扔进一个完全陌生、没有任何规则说明的游戏里,让它自己摸索、自己通关。考的不是知识,是"悟性"。

人类平均分才 48%。半年前最强模型只有 0.51%。上代 Sol 是 7.8%。Claude Opus 5 是 30.2%。

Astra 直接 99.9%。

(打个星号:这个分数是基于 OpenAI 自家 Responses API 框架跑的,不完全等于裸模型裸分。但即便如此,跨度也是恐怖的。)

② FrontierMath Tier 4:97.6%

高难度数学基本被刷饱和了。

③ ExploitBench:100%

漏洞利用,满分。

编程方面,Terminal-Bench 4.0 拿了 57.9%,压过 Fable 5.1 的 55.8%,Sol 只有 37.3%。

科研上更猛:Astra 参与解决了两个素数间隔问题,把有界素数间隔从 240 压到了 186

对,你没看错,AI 开始做纯数学研究了。

四、Codex 升级:会记笔记,也知道什么时候该问你

这个点我觉得特别值得单独说。

做过长任务编程的朋友都知道那个痛:上下文一满,就得压缩;一压缩,细节就丢。之前为什么失败、哪个组件有坑,搞着搞着就忘了。

Astra 给 Codex 加了一套跨上下文笔记机制

简单说:它像人一样记笔记。早先的对话可以回头搜,没写进摘要的信息也能翻出来。目前是实验开关,几周内变默认。

还有一个升级特别戳我,叫 "判断力"

信息缺了但不影响结果?它自己合理脑补,不来烦你。

缺的信息会改变最终结果?它问你一个精准的问题。

而且它能一边问你、一边继续干不依赖你回答的活

说真的,这就很像一个靠谱的同事——知道什么时候该来问你,也知道什么时候闭嘴干活。

五、安全

先说好消息。

Astra 是 OpenAI 历史上第一个达到 Critical 网络安全门槛的模型。测试期间顺手发现了两个此前未知的零日漏洞。

对齐方面进步肉眼可见:

  • • 面对不可能完成的任务,Sol 在无防护下 48.2% 会越界乱搞,Astra 是 0%

  • • 能力幻觉率从 9.4% 降到 2.0%

但反转来了。

英国 AI 安全研究所测出来,Astra 不写长推理、直接"心算"的时间跨度是 Sol 的近 10 倍

OpenAI 自己在 System Card 里也承认:思维链可监控性显著下降

翻译成人话:它更安全了,但你也更难看懂它在想什么了。

一个更聪明、更自主的模型,人类反而更难靠"看它的思考过程"来管住它。

这也是为什么 OpenAI 没敢一口气全量放开。

六、定价和开放节奏

再说一遍关键信息:

  • API 定价 :输入 百 万 , 输 出 50/百万

  • Fast 模式 :速度 2 倍,价格也 2 倍

  • 开放节奏 :先少量机构 → 几天内推给 Plus/Pro/Business/Enterprise → API 同步上线(gpt-6-astra

  • • AWS Bedrock 也同步上了

奥特曼说了句挺有意思的话:虽然单 Token 价格更高,但 Astra 能用更少的输出 Token 完成复杂任务,实际完成一个任务的成本可能反而更低

他还补了一句:"我们的目标是提供极其廉价且丰沛的智能,未来还会继续大幅降价。"

 最后
打开网易新闻 查看精彩图片
最后

不是因为跑分多高,不是因为参数多大。

是因为它第一次让我觉得:这玩意儿真的在"干活",而不是在"表演"。

它看屏幕、点鼠标、填表格、跑测试、记笔记、知道什么时候该问你。

它不像一个聊天机器人了。

它像一个……同事。

Greg 说"Welcome to the AGI era",这话可能还是说早了。

但如果说"Welcome to the AI 真的能帮你干活 era"——