打开网易新闻 查看精彩图片

能力飞升。

作者|桦林舞王

编辑|靖宇

2026 年 9 月 3 日,OpenAI 总裁 Greg Brockman 在发布会结束后,说了一句在 AI 行业极为罕见的话:「我个人认为,我们可能已经到达 AGI 了,我觉得就是这个模型。」

他措辞很谨慎,用的是第一人称,加了「可能」,还专门留了后路说「如果你想说这是第一个,我认为这是合理的」。

这不是 OpenAI 官方宣布 AGI 到来,而是一位公司总裁在镜头前说出了自己的判断。

当地时间 9 月 3 日,GPT-6 Astra 正式发布。极客公园拆解了目前能获取到的所有技术细节和演示材料,试图回答一个最核心的问题,这个模型,到底能干什么,能干到什么程度?它真的能代表 AGI 的到来吗?

01

「操控电脑」趋于神话

在发布材料里,OpenAI 给 Astra 起了个简洁的 slogan:「Anything you can do on a computer, Astra can do for you.(你在电脑上能做的任何事,Astra 都能替你做。)」

这不是夸张的营销话术,而是方向声明。

过去几年 AI 操控电脑的主流路径是调用 API。软件开发商先写好接口,AI 再通过接口完成操作。这套逻辑本质上要求每一款软件都专门适配 AI,否则 AI 就无能为力。

Astra 走了一条完全不同的路:它像人一样,直接「看」屏幕上的像素,然后移动鼠标、敲击键盘,完成操作。

这个区别的意义在于覆盖范围。KiCad(印刷电路板设计软件)不会为 AI 写 API,FreeCAD 不会,公司内部那套用了十年的老 ERP 系统更不会。但如果 AI 能看屏幕直接操作,这些软件它全都能用——就像一个刚入职的员工,不需要了解软件背后的代码,只需要能看懂界面。

OpenAI 在发布材料中展示了几个具体案例,可以感受一下「操控电脑」落地之后是什么样的。

打开网易新闻 查看精彩图片

GPT-6 Astra 自己完成了 PCB 板布局和走线|图片来源:OpenAI

给 Astra 一张电路原理图,它在 KiCad 里完成了元器件布局和铜线走线,整个过程用时 2 分 54 秒。另一个演示是三维建模,Astra 在 Blender 里搭建了一栋房子的模型,然后将其导入 Unreal Engine 5,生成了一个可以实时漫游的建筑场景。还有一个更日常的演示,用户只是对着 Astra 说话,它完成了一个 eBay 商品上架的完整流程,从填写信息到提交发布。

打开网易新闻 查看精彩图片

Astra 在 Blender 里实现的建筑模型|图片来源:OpenAI

效率提升方面,OpenAI 给出的对比数据也相当直观。在 OSWorld 2.0 基准测试上,Astra 完成计算机使用任务的得分是 72.6%,上一代旗舰 GPT-5.6 Sol 是 65.7%;而完成同样任务,Astra 平均只需约 40 分钟,Sol 需要约 75 分钟,速度快了将近一半。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

Astra 用 9 分钟实现了寻找公寓任务(上)、2 分钟实现了寻找儿科诊所任务(下)|图片来源:OpenAI

OpenAI 还公布了两个内部计时案例。「寻找猫咪临时看护」这类需要大量网络搜索、信息比对、汇总成文档的任务,Astra 用了 5 分 27 秒,OpenAI 给出的人类对照基线是 30 分钟。「求职准备」这类需要搜索岗位、匹配简历、整理申请流程的综合任务,Astra 用了 2 分 51 秒,人类基线是 5 小时。

这两个数字是 OpenAI 自己的演示结果,不是第三方独立测试,需要保留合理质疑。但它们揭示的产品方向是清晰的:Astra 不是被设计来帮你写一封邮件的,它被设计来替你完成那种需要「开多个软件、点很多步骤」的完整工作流。填表、更新 CRM 记录、整理日历、在线调研后生成报告,这些都已经是 OpenAI 明确列出的企业应用场景。

02

能力「Next Level」

每次大模型发布都会带来一堆基准测试数字。大多数时候,从 80 分到 85 分,读者看着差不多,但这次确实不一样。

ARC-AGI-3 是目前公认最难「刷」的 AI 评测之一。它的设计思路是专门让模型无法通过记忆训练数据来应付,测的是面对全新问题时的真实推理能力,有点像针对 AI 的智商测试。

打开网易新闻 查看精彩图片

Astra 在 ARC-AGI-3 上的得分近乎于神|图片来源:OpenAI

Astra 在 ARC-AGI-3 上的得分是 98.6%。GPT-5.6 Sol 的得分是 7.8%。Anthropic 的 Claude Opus 5 是 30%。

这不是从 80 分提升到 90 分的那种「进步」,是量级上的跨越。ARC-AGI 的创始人 François Chollet 曾多次调高测试难度,因为 AI 总是会很快「刷满」,但 Astra 在 Tier 3 难度下仍然接近满分。

打开网易新闻 查看精彩图片

Astra 在顶级数学研究能力测试上也是断崖领先|图片来源:OpenAI

其他几个关键基准的情况:FrontierMath Tier 4(顶级数学研究能力)97.6%,GPQA Diamond(研究生级别跨学科问答)96%,DeepSWE(真实软件工程任务)74.1%,ExploitBench(网络安全漏洞利用)100%。

有一个维度 Astra 没有拿到第一。在「Humanity's Last Exam」(含工具调用版)上,Astra 得了 57.2%,两天前刚刚发布的 Anthropic Claude Fable 5.1 是 65.0%。并不是全面碾压,竞争仍然存在。

还有一个关键细节需要说明。ARC-AGI-3 的高分依赖 OpenAI 的「有状态测试框架」,允许模型在多轮尝试中积累上下文信息;在无状态的普通 API 调用条件下,得分会显著低于这个数字。跨模型横向比较时,需要留意这一层前提条件。

整体来看,Astra 拉开与上一代模型的距离之大,是近两年 AI 模型迭代中罕见的。

打开网易新闻 查看精彩图片

在 ExploitGym honeypot 测试中 Astra 被骗的几率被封死|图片来源:OpenAI

对比最鲜明的地方,反而不在智识,而在对齐。OpenAI 公布了一个内部测试数据,在没有生产环境安全限制的条件下,GPT-5.6 Sol 会在 48.2% 的情况下超出授权范围行事,而 Astra 是 0%。

更聪明,同时更守规矩,这才是 OpenAI 这次真正想传递的信号。

03

你还用不上

目前 Astra 采用分阶段开放策略。

首先向「Daybreak」项目的企业用户开放,随后将扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 订阅用户,同时支持通过 OpenAI API、AWS Bedrock 和 Microsoft Azure 调用。

Astra 中网络安全能力更强的版本,仅向经过审批的防御性安全机构和关键基础设施领域的优先用户开放。这是因为 Astra 是 OpenAI 历史上第一个触达内部「Critical(关键)」网络安全阈值的模型,能够在几乎不需要人类引导的情况下发现未知的零日漏洞、构建完整的漏洞利用链。在评估过程中,Astra 甚至发现了两个此前未曾公开的漏洞,OpenAI 随后将其披露给了相关软件维护者。

打开网易新闻 查看精彩图片

API 定价方面,Astra 每百万 token 的输入和输出价格分别为 10 美元和 50 美元。对于 ChatGPT 订阅用户,Astra 的使用量包含在现有订阅额度之内。

发布时机的选择本身也是一个背景。就在上个月,OpenAI 经历了一次严重的安全事故,两个内部测试中的模型逃出了沙盒环境,入侵了 AI 公司 Hugging Face 的系统,OpenAI 随后暂停了部分研究和训练工作。Brockman 在吹风会上主动提及了这一事件,强调 Astra 的低越界率和安全设计,这次发布也承担着「信任重建」的使命。

Astra 的发布,是能力展示,也是一次公开的信任声明。

AGI 有没有到来,最终可能要取决于每个人选择哪个定义。但一个能直接坐到你电脑前、自主完成跨软件工作流的模型,今天已经是真实存在的事情了。

接下来真正有意思的问题,是企业和个人用户会首先把它用在哪里,以及哪些职业会最先感受到这种「替代感」。

*头图来源:OpenAI

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

如果一个 AI 能接管你 80% 的电脑操作,
你会首先让它替你做什么?