刚刚,OpenAI CEO 山姆·奥特曼在 X 平台宣布,GPT-6 Astra 已向所有 Plus 和 Business 用户开放。
至此,Astra 完成了面向所有付费用户的全量推送。
9 月 3 日 Astra 刚亮相时,OpenAI 选择的是分阶段灰度策略,只有Daybreak 网络安全计划中的少数企业客户能优先体验。
而大量 Pro 付费用户习惯了“发布即用”,反而被挡在门外。
社交媒体上吐槽声不断,奥特曼本人也紧急道歉,承认这次上线“很乱”,“我们搞砸了”。
为了安抚用户,OpenAI 还推出了补偿措施:从 9 月 4 日起,付费用户每缺少一天 Astra 访问权限,就能获得一次额度重置,可用于后续使用。
Codex 工程负责人 Thibault Sottiaux 表示,团队正在“竭尽全力”尽快开放访问。
AI 开始像人一样操作电脑
当地时间 9 月 3 日,OpenAI 正式发布新一代旗舰大模型 GPT-6 Astra,Astra 在拉丁语中意为“星辰”。
发布会收尾时,OpenAI 联合创始人兼总裁 Greg Brockman 留下一句相当罕见的宣言:“欢迎来到 AGI 时代。”
CEO 山姆·奥特曼也随后发文表示,希望 Astra 能够开启“新一代的创业、科学发现与创造”。
值得注意的是,OpenAI 在强化“更强推理、更高分数、更优代码”的这些传统指标的基础上,借GPT-6 Astra正式将竞争焦点推向Agent 应用。
OpenAI 给 Astra 起了一个简洁的 slogan:“Anything you can do on a computer, Astra can do for you.”(你在电脑上能做的任何事,Astra都能替你做。)
过去,AI 操控电脑的主流方式是调用 API:软件开发商先把功能封装成接口,AI 再通过这些接口发出指令。
这种方式效率高,但有一个天然限制:软件必须先提供 API,否则 AI 很难直接操作。
Astra 走的是另一条路:它不再完全依赖软件预先提供的 API,而是可以像人一样“看”和“操作”电脑界面。
识别屏幕上的文字、按钮和图像,再通过鼠标点击、拖拽和键盘输入完成任务。
同时,它也会结合浏览器、终端、文件系统等工具,在“视觉操作”和“程序化调用”之间自由切换。
这就是 Astra 此次最核心的升级之一:Computer Use。
比如,以前你问 AI “Excel 里这组数据怎么处理”,它可能会告诉你具体步骤。
现在,你可以直接把任务交给 Astra,让它自己打开 Excel,读取数据、填写表格、处理信息,再根据操作结果继续往下执行。
此外,OpenAI 还重点强化了软件工程、科学研究、数学推理、网络安全等能力。
全面碾压的跑分成绩Astra 的发布时间卡在 Claude Fable 5.1 发布仅两天后,OpenAI 几乎是踩着对手的发布会,全面“狙击”了 Anthropic。
OpenAI 公布的 Benchmark 数据显示,GPT-6 Astra 在多个测试中拿到了目前顶级模型的成绩。
其中最吸睛的,莫过于在 ARC-AGI-3 测试中,Astra 拿到了99.9%。
此前,GPT-5.6 Sol 在这一测试中的成绩只有7.8%,而 Astra 直接来到99.9%。
与上一代 GPT-5.6 Sol 相比,这次已经很难用简单的“优化了一点”来形容:
OpenAI 还透露,Astra 已经帮助解决数学领域一些长期开放的问题,包括在素数间隔研究中取得两个新的理论结果。
如果这些成果最终能够经受学术界进一步验证,那么它意味着 AI 在高阶数学和科研辅助领域,正在从“辅助计算”进一步走向“参与发现”。
价格翻倍,但性价比反而更高
GPT-6 Astra 在定价上,没有选择用更低的 Token 价格去制造“性价比”,而是把价格实打实地涨了上去。
相比 GPT-5.6 Sol,Astra 的单 Token 价格约为上一代的2.5 倍。
Astra 的定价与 Fable 5.1 基本处于同一水平,而在部分实际任务中,它的单位任务成本反而更低。
在 Terminal‑Bench 科学任务上,Astra 的单任务成本约为 Claude Fable 5.1 的 36%,便宜了约 64%。
在 Coding Agent 场景下,Astra 的单任务成本不到 Claude Fable 5 的一半。
背后的关键,是 Astra 采用了一套名为“循环深度”(Recurrent Depth)的新架构。
它允许模型在内部多次迭代打磨推理过程,而不必把冗长的“思考链”全部展开成 token 再“读”回来,从而大幅减少无效 token 消耗。
在DeepSWE v1.1测试中,Astra 的任务成本比 GPT‑5.6 Sol 的最佳配置低了约57%。
再加上五级推理强度调节(从 low 到 max),用户可以根据任务难度灵活调配思考深度,在性能与成本之间找到更合适的平衡点。
理论跑分再高,终究不如把模型拉出来实际跑一遍。
Astra 这次最有意思的地方在于,它给出的案例几乎都指向同一个变化:AI 不再只是帮你生成内容,而是开始自己把任务做完。
1. 游戏开发:从“写代码”到“做游戏”
OpenAI 分享的案例中,初创游戏公司 Playco 使用 GPT-6 Astra 制作游戏原型。
从一个灰盒基础原型出发,快速生成了3个不同主题的游戏版本,人工修复工作减少了 50%。
单看这件事并不稀奇,毕竟过去的 AI 也能写游戏代码。真正不同的地方在于,Astra开始进入了完整的开发闭环:
写代码 → 运行 → 看结果 → 找问题 → 修改 → 再运行。
以前是 AI 把代码交给你,你负责运行和调试;现在变成 AI 自己运行、自己检查、自己修改。
X 上已经有开发者直接用 GPT-6 Astra 做出了一款卡丁车游戏,生成完成后就能在浏览器中直接运行。
即使完全不懂编程,也可以在几分钟内创建并玩上自己的游戏。
过去,一个不会编程的人想做一款能玩的游戏,至少要跨过代码、引擎、调试、部署等一堆门槛。
现在,这些复杂环节正在被 Agent 一口气接过去。
科技博主 Matthew Berman 在获得Astra早期访问权限后,连续测试了游戏、代码、写作、浏览器控制、PPT制作以及各种知识工作。
他的评价相当直接:这是他用过的最强模型,没有之一。
他只用了2个提示词,就让 Astra 从零生成了一款可以运行且真正好玩的游戏。
2. 浏览器控制:自己搜、自己看、自己整理
在浏览器控制方面,Matthew Berman 认为 GPT-5.6 Sol 已经做得相当不错,但 Astra 是另一个层级,而且明显更快。
他做了一个测试:让 Astra 规划一条京都步行游览路线。
整个过程里,Astra 自己打开浏览器、搜索资料、整理信息,再完成路线规划,基本不需要人工介入。
这时候,AI 和传统搜索工具之间的区别就非常明显了。
以前是:你搜索 → 你筛选 → 你整理 → 你规划。
现在则变成:你提出目标 → AI自己搜索 → 自己判断 → 自己整理 → 直接交付结果。
在持续运行能力上,Astra 同样展现出了惊人的一面。
Berman 跑了一个 SimCity 克隆版,让 Astra 持续进行开发和运行,结果连续运行了 5 天还没结束。
3. 3D建模:进入专业生产力场景
如果说游戏开发展示的是 Astra 的“动手能力”,那么 3D 建模则更加接近专业生产力场景。
X 上有开发者直接将 GPT-6 Astra 与 Claude Fable 5.1 放在 Blender 中进行对比。
Astra 可以根据自然语言提示,在 Blender 中建立完整的 3D 场景,从一栋房子的整体结构,到无边泳池、客厅、厨房、卧室,甚至泳池里的火烈鸟,都可以被直接建模出来。
更夸张的是,另一位博主他翻出一张老旧的蒸汽火车手绘图,把它丢给 Astra,让它在 Blender 里重建。
几分钟后,Astra 生成了3295 个完全可编辑的详细对象,几何结构干净漂亮。
值得一提的是,模型建立完成后可以继续手工编辑,也能够像普通 3D 场景一样实时运行。
除了 3D 建模,Astra 在前端设计上也有不少讨论。
给 Astra 一张电路原理图,它在KiCad里完成了元器件布局和铜线走线,整个过程仅用时2 分 54 秒。
但 Astra 在精确性上仍有短板,不少测试者发现,在需要精确操作界面元素的场景下,模型偶尔会出现误判:比如把按钮当成文本,或者误解某个交互组件的功能。
还有就是幻觉问题,在涉及音乐版权、社媒账号配置等需要准确信息的场景中,Astra 给出的建议可能不够严谨,甚至会捏造不存在的操作路径。
从 Anthropic 的 Fable 5.1,到 Google 的 Gemini 3.8 Flash,再到 OpenAI 的 GPT-6 Astra,短短几天,三家头部 AI 公司轮番出牌。
但看完这一轮更新,会发现大模型真正卷的,已经不只是“谁更聪明”,而是:谁更能干活。
你说 Astra 是 AGI 吗?狐妹觉得还不是。
但它让我们第一次这么直观地看到 AGI 长什么样:一个能自己看屏幕、动鼠标、敲键盘,把一整件事从头干到尾的 AI。
不过先别急着焦虑。因为已经有网友替大家算了一笔账:这些模型的 Token 价格并不便宜。
你想想,是不是这个理?至少现在,人还是挺有性价比的。能处理复杂沟通、能临场应变,算力不用按 Token 计费……AI 暂时还真没这么划算。
但细思极恐的是:AI 的价格只会越来越便宜,能力却还在越来越强。
这一次,Astra 已经把“AI 能替人做什么”的边界,又往前推了一步。
编辑:不吃麦芽糖
热门跟贴