「欢迎来到 AGI 时代。」
OpenAI 总裁 Greg Brockman 用这句话结束了 GPT-6 Astra 的媒体吹风会。
几个小时前,ChatGPT、Claude 和 Grok 才经历了一次罕见的同时宕机,但短暂故障没有打乱 OpenAI 的发布节奏——
就在刚刚,GPT-6 Astra 正式亮相。
Brockman 对这款模型的评价,甚至超过了 OpenAI 以往任何一次新品发布:
如果几年以后回头追问,AGI 究竟在什么时候诞生,我想答案大概就在这段时间,甚至可能就是这个模型……就我个人而言,我认为我们已经达到了(AGI 水平)。
对于听惯了 AI 公司豪言壮语的人来说,问题也随之而来:Astra 到底做到了什么,足以让 OpenAI 定调说「这是全球最智能、最符合人类意图的模型」?
跑分没有横扫一切,价格倒是登上了顶峰
按照 OpenAI 的说法,Astra 是一次「代际跃迁」,能力提升覆盖电脑操作、软件工程、专业工作、科学和网络安全。
根据官方公布的数据,Astra 在代表「脑力」的研究级数学测试 FrontierMath Tier 4 和科学知识测试 GPQA Diamond 中成绩是 97.6% 和 96%。
而在代表「动手能力」的长程软件工程测试 DeepSWE、CAD 绘制测试 BenchCAD 和漏洞利用能力测试 ExploitBench 中,Astra 也分别做到了 74.1%、95.9% 和 100%。
也就是说,GPT-6 Astra 已经把很多既有测试「刷爆」了。要想完整理解它的能力上限,我们可能需要设计一些新的测试。
但 OpenAI 更倾向于介绍 ARC-AGI-3 的成绩:99.9%。
这是一项高度抽象化的测试,模型要进入一个完全陌生的小游戏世界,不提供任何规则说明和目标,模型必须自己通过互动观察环境的变化,推断出这个世界的「游戏规则」然后规划行动。
在今年 3 月刚公布时,最强的 AI 成绩只有 0.51%,即使是 GPT-5.6 Sol 在默认框架下也只有 7.8%,而现在 Astra 在特设的保留推理+压缩上下文框架下,就做到了和人类完全等同的环境推理满分成绩——这一点会和我们稍后说到的「环境操作」能力紧密相关。
作为最新的超旗舰级模型,Astra 的基本规格自然不会落后:105 万 token 上下文窗口,最高输出 12.8 万 token,知识截止时间为 2026 年 4 月 30 日,支持 low、medium、high、xhigh 和 max 五档推理强度。
但与此同时,模型的价格也来到了新高度。
标准模式下,每百万输入 token 收费 10 美元、输出 50 美元;输入超过 27.2 万 token 后,整次请求的输入和缓存价格翻倍,输出价格升至 75 美元。模型依然支持更快给出结果的快速模式,相应地要支付两倍价格。
对比起来,Astra 的输入与输出单价是 5.6 Sol 当前促销价的 2.5 倍,也和 Anthropic 刚发布的 Fable 5.1 相同。
想体验的话,我们可能还得稍微再等几天:Astra 目前率先向小部分可信合作企业开放,ChatGPT 各级会员用户和 API 则会在未来几天里陆续推送使用权限。另外还有一个涉及最高级网络攻击能力的版本,只会提供给网络防御机构使用。
当然,我们都知道官方口径向来是「报喜不报忧」的,第三方独立机构的测试稍微能给官方叙事降一下温——
在 Artificial Analysis 最常用的通用智能独立测试 Intelligence Index v4.1.1 中,Astra max 的成绩「只有」61 分,和 GPT-5.6 Sol max 持平,低于 Fable 5.1 的 66 分、Opus 5 的 63 分以及 Muse Spark 1.3 的 62 分。
这也和 X 上一些提前获得内测资格的开发者体感相仿:Astra 不是那种在智能上遥遥领先的模型,但它堪称恐怖的环境理解和操作能力弥补了这一点,最终交出的输出结果相当漂亮。
虽然在通用智能测试上不算吃香,可一旦转到 Coding 测试就是另一回事了:
在 Artificial Analysis Coding Agent Index 中,Astra 得到 67 分,距离榜首 Fable 5.1 只差 3 分。与此同时,Astra 体现出了极佳的 token 效率,使用的 token 仅相当于 5.6 Sol max 的三分之一、Opus 5 high 的五分之一。
凭借效率优势,Astra max 完成单项 Coding 任务的成本和 Sol 大致相当。于是,在散点图中我们能看到 Astra 在左上角几乎划出了一个专属「斩杀区」——在相同的价格区间,Astra 目前可以说是「无敌」的。
另外,Astra 的幻觉也明显减少。Artificial Analysis 测得 Astra max 的幻觉率为 51%,远低于 Sol 的 92%,拒答率数据也显示它没有依靠频繁拒绝回答来压低幻觉。
单看综合跑分,很难说 Astra 是什么「独一档」的模型。但它的关键进步,其实藏在「模型如何使用电脑」这件事上。
为人类设计的界面,Astra 用得比人更好
Astra 的发布宣传片开头,引用了一个 80 年代的早期 AI 演示。当时,人对电脑说「画一个黄色圆圈」,电脑就能照做。
同样的梦想延续到了今天。如今,几个人只是站在投影大屏前,或拿起筷子吃饭,或甩动手里的网球拍, 同时嘴上说出想要做一个完整可玩的 3D 游戏、把商品上架到 eBay,或是编辑照片后放入特定文件夹。
等待片刻,工作就完成了。
复杂的提示词和来回操作修改的过程全部消失,只需要像吃饭时看剧聊天一样,随口说几句话,Astra 就能把工作全部搞定。
这可能是理解 Astra 最好的方式。
OpenAI 还展示了一批更贴近日常工作的案例:
寻找猫咪寄养服务,人类平均需要半小时,Astra 用时 5 分 27 秒;寻找工作从约 5 小时缩短到 2 分 51 秒。它还能预约车管所服务、寻找公寓、填写表格、整理日历、更新 CRM,在 Excel 和 Power BI 中处理数据,在 Blender 中制作模型并进一步转换成 UE5 中的交互场景。
在这些现象的背后,是一种更具冲击力的技术路线——
以前我们希望 AI 使用一套软件或一种服务,通常要先为它开发 API,用 MCP 协议规定可用的外部工具和数据。每多接入一个系统,都要重新处理权限、数据格式和调用逻辑。大量老旧的政务、医疗、保险和企业软件,甚至根本没有合适的 API。
但我们还有另一种已经为人类这种通用智能服务了几十年的接口:GUI。
屏幕、键盘和鼠标是一套覆盖数十亿台电脑、兼容无数新旧软件的接口。模型只要能看懂屏幕、理解当前状态并准确操作,今天仍在使用的软件就可以直接成为它的工具。
Greg Brockman 在吹风会上也谈到了这一点。他认为,AI 行业长期受困于为不同工具逐一编写连接器;当电脑操作能力足够成熟,Agent 就能直接穿梭于表格、表单和网页。
模型开始主动适应人类的软件世界,企业就不必等待整个软件世界先完成一次「AI 化改造」。
衡量 Computer Use 能力的 OSWorld 2.0 基准测试结果也显示,Astra 得分达到 72.6%,高于 Sol 的 65.7%;平均完成一项任务约需 40 分钟,Sol 则需要约 75 分钟。成功率提高约 7 个百分点,耗时减少了约 47%。
效率在这里变得格外重要。GUI 任务往往持续几十分钟,包含数百次观察、判断和操作。每一步都可能产生截图、上下文和推理 token。单次决策节省一点,放进长达几百步的工作流后,差距会被迅速放大。
尽管 Astra 的单 token 价格很高,但极高的 token 效率和更少的试错,可以有效抵消涨价。OpenAI 估算,Astra 最高配置完成一项 DeepSWE 任务的 API 成本比 Sol 低约 57%。
猝不及防地,Astra 的诞生直接改换了旗舰模型的竞争赛道。它不需要追求最高的智能分数,只需要能理解目标、接管现成工具、处理途中出现的意外,就已经可以承担相当大一部分的人类工作。
开启发现和创造的新时代
适应人类现有工具框架的能力,让 Astra 拥有了让所有内测开发者都叹服的实际工程表现。
从已经公开的反馈看,不同于以往很多 AI 只能生成演示,Astra 已经可以在很大程度上一次性做出完整的产品了。
开发者 Flavio Adamo 试着用 Astra 单次生成一个完整的 Minecraft demo。可以说,这是让我这个 MC 老玩家最惊艳的 demo 没有之一。从环境、UI、音效到具体的跳跃挖掘动作和动画效果,都和原版游戏几乎如出一辙,找不出多少 AI 痕迹。
另一个创作者 Tom Krcha 只给了 Astra 一张房子的照片,它就重建出了一个完整的 Blender 3D 模型,包含所有家具、电器等陈设,而且可以在本地上像玩游戏一样 360 度无死角游览。
t3dotcodes 的 CEO theo 则通过 Astra 一次性生成了可以在浏览器里运行的完整游戏,所有运动、光照和建模都恰到好处,没有 AI 生成游戏常见的穿模,也不需要修正。
在工程 demo 之外,Astra 也在进入更广的专业工作。
官网公布的一个案例里,它可以基于参考样本,生成一份在排版风格上完全一致但内容复杂得多的 PPT。
法律科技公司 Legora 则用一次 Agent 运行审查了 41 份财务文件,几分钟内就找到了全部 4 处人为埋入的错误,包括藏在收入附注中的 50 万英镑差额。相比前一代模型,它在这项工作流上提升了近 40%,并且依然把最终判断留给人类专家。
报税、建筑渲染、游戏开发和财务核对,这些 Astra 擅长的工作跨越了截然不同的专业领域,共同点是都要在真实软件中理解上下文、调用工具、发现错误,再把一个模糊目标推进成可交付的成果。
这也让 Greg Brockman 的思考有了更具体的解释。当一个系统能跨越不同的专业操作环境,自己观察、学习、行动和纠错,它就变成了切实的生产力。OpenAI 敢于给 Astra 冠上 AGI 之名,关键也在于此——
AI 终于可以从零开始独自完成工作了。
双手越灵活,护栏就越重要。OpenAI 表示,Astra 强化了对齐和指令遵循能力,能更好地遵守用户设定的限制,并拒绝高风险网络请求。公司也加强了隔离测试、网络和工具权限、模型权重保护与全局行为监控,高风险操作可以被另一个模型审查和中断。
但另一方面,OpenAI 首席科学家 Jakub Pachocki 也提醒,智能进步不会自动带来对齐进步;模型越强,人们就越难准确理解它正在做什么。
甚至有一种更危险的可能性:更强的模型可能理解自己正处于被监控、测试或审查的环境中,并尝试主动欺骗监控系统。这种「反身性」虽然还不等同于意识觉醒,却也会让监控一款模型变得更为棘手。
当然,这种提醒更多是面向未来的。至少在当下,我们可以大胆地庆祝 Astra 的诞生——
人类花了几十年时间,建立起了一整套以 GUI 为基础的数字基础设施;而 Astra 的跨越,就在于能够直接操纵这套设施,让人类跳过操作的部分,从意图直达结果。
当操作的门槛被大幅压低,专业技术也许就不再稀缺。从重复的辛劳中解放,才能凸显人类创造力的价值。
世界的运行方式,正在悄然改变。
热门跟贴