出品 | 网易智能
作者 | 小小
编辑 | 王凤枝
"AGI时代",OpenAI挑明了。
北京时间9月4日凌晨,OpenAI正式发布新一代前沿模型GPT-6 Astra。发布会收尾时,联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)留下一句话:"欢迎来到AGI时代。"
Astra这次最显眼的变化,落在了操作电脑上。在OSWorld 2.0离线任务集的部分评分中,它拿下72.6%,平均任务耗时从上一代的约75分钟压到了40分钟。这份能力的标价也水涨船高:API输入和输出价格分别为每百万Token 10美元和50美元,直接拉到了GPT-5.6 Sol当前促销价的2.5倍。
这大概是OpenAI选在这个节点喊出"AGI时代"的原因。它押注的不是某单项跑分的高低,而是模型能力形态的转变:同一个模型既能在复杂的科学与编程问题里做深度推演,又能直接摸索人类日常使用的图形界面,接管一整段具体工作。
OpenAI把Astra称为"全球最佳的计算机使用模型"。它无需专门适配,便能直接操控浏览器、电子表格、桌面软件和网页,执行填表、更新CRM客户记录、排定日历、跑代码、做数据分析,甚至创建网站与演示文稿等多步骤流程。
OpenAI研究员米娅·格莱塞(Mia Glaese)在现场提到,用户眼下能做的事,不到一年前还显得不切实际;接下来,人们会把更繁重的执行过程甩给AI,自己退到宏观指导的位置。
Astra首批仅对少数受邀机构开放,未来数天内会逐步推送给ChatGPT Plus、Pro、Business与Enterprise用户,同时接入OpenAI API和Amazon Bedrock。
在布罗克曼的解释里,AGI不一定由某项测试划出分界线,更重要的是,人类已经愿意把多少工作交给AI。Astra能不能撑起这个判断,最终要看三件事:它能不能稳定把活干完,企业付不付得起,又敢不敢把真实权限交给它。
01 Astra开始真正操作电脑
计算机使用能力,是Astra这次最核心的卖点。
布罗克曼在发布会上回顾了OpenAI早期的研究思路:围绕人类使用计算机时获得的相同输入和输出,也就是像素、键盘和鼠标,训练一个能够自行完成任务的智能体。
过去很长一段时间,开发者需要为不同软件编写连接器,把模型接入一个又一个工具。Astra试图换一条路:直接看屏幕、使用键盘和鼠标,像人一样在不同应用之间完成操作。
开头提到的OSWorld 2.0成绩,来自无需联网的离线任务集,并采用部分评分,不能直接理解为Astra已经能完成72.6%的真实企业流程。但在同一口径下,它确实比GPT-5.6 Sol得分更高,模拟的平均任务耗时缩短约47%。
在Agents' Last Exam测试中,Astra得分59.3%,高于Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%;在各自最高分配置下,它使用的输出Token比Claude Opus 5少约65%。
OpenAI还展示了Astra在多类软件中的操作:在KiCad中完成印刷电路板布局,在Blender中建模房屋并导入Unreal Engine 5生成可步行场景,填写美国1040税表,在Power BI中处理数据,并对网站进行前端质量检查。
美国AI创业公司Cognition的高级研究副总裁西拉斯·阿尔贝蒂(Silas Alberti)表示,公司在发布日把Astra接入了AI编程产品Devin。内部测试中,Astra的计算机使用、写作和代码库理解能力提高了测试效果,生成的视频更容易理解,报告也更加清晰。
这些变化意味着,模型不再只是告诉用户"下一步应该怎么做",而是开始自己进入软件,把中间步骤做完。
02人不在场,Agent也能继续干活
Astra尚未大规模推送,一些提前拿到访问权限的人已经分享了使用体验。
AI投资人、HyperWrite前CEO马特·舒默(Matt Shumer)讲述了他的第一个"啊哈"时刻。他让Astra在虚幻引擎中创建一个世界,放入由Astra驱动的角色,并要求这些角色合作生存。一天后,他在卧室里听到客厅传来声音,以为有人进了公寓;走出去才发现,是这些Agent开始互相交谈了。
舒默发布的视频还展示了一个曼哈顿风格的城市场景。据他称,Astra用一周时间在虚幻引擎中逐步搭建并完善了这个世界。他的评价很直接:"显然还不是百分之百完美,但仍然疯了。"
这仍是舒默个人的预览体验,视频也无法证明类似行为会在普通用户手中稳定复现。但它把Astra的变化直观地表现了出来:人不必一直守在屏幕前,逐步告诉Agent下一步该做什么。
开发者兼YouTube博主@theo表示,他已经使用Astra数周。计算机操作、3D、数据分析、科学研究、视觉、多Agent协作和调试等能力,让他感到这是一次代际提升,有时甚至像是"AGI的一瞥"。不过他也提到,Astra仍有一些怪癖和粗糙之处。
OpenAI自己的演示更接近日常办公。Astra只参考演示模板中的几张幻灯片,便制作出一套关于虚构模型GPT-Gaia的完整演示文稿,并保持了相对统一的语气和版式。
这类案例比"会不会写一页PPT"多了一层要求。模型需要持续理解模板、内容和任务进度,走完多个步骤之后,依然清楚自己正在完成什么。
03跑分接近刷满,GDPval却没有出现
Astra的官方成绩单里,出现了几组接近满分的数字。
在FrontierMath Tier 4 v2上,Astra得分97.6%,GPT-5.6 Sol为80.5%;在GPQA Diamond上,Astra得分96.0%。最醒目的是抽象推理测试ARC-AGI-3:Astra得分99.9%,上一代GPT-5.6 Sol只有7.8%。
不过,99.9%不能简单理解为底层模型自身从7.8%跃升至接近满分。OpenAI明确注明,Astra使用了Responses API Harness。此前英伟达也曾为Claude Opus 5加入持续记忆、工具、反馈和恢复机制,使其在ARC-AGI-3公开集达到100%,而底层模型的基线约为30%。这项测试越来越多地转向衡量完整的Agent系统,而不单是模型权重。
在编码测试Terminal-Bench 4.0中,Astra得分57.9%,高于GPT-5.6 Sol的37.3%和Claude Fable 5.1的55.8%。在DeepSWE v1.1中,Astra得分74.1%,高于GPT-5.6 Sol的72.7%,但略低于Meta Muse Spark 1.3公布的75.4%。
网络安全方面,Astra在ExploitBench上取得100%的成绩,GPT-5.6 Sol为78.5%。在SRE-Bench中,Astra单次尝试解决了88.0%的任务,四次尝试内解决了99.2%,上一代分别为55.9%和68.7%。
OpenAI表示,Astra是第一个达到其准备框架中"关键"网络安全能力阈值的模型。在具备适当工具和访问权限时,它可以在缺少持续人工指导的情况下寻找未知漏洞,并进一步开发利用链。评估期间,Astra还发现并使用了两个此前未知的零日漏洞,OpenAI已将它们披露给相关维护者。
就在这份几乎覆盖所有能力的成绩单里,OpenAI没有公布Astra在GDPval上的表现。
GDPval是OpenAI在2025年推出的一项基准,用于衡量模型能否完成真实世界里的知识工作,覆盖美国九大行业、44种职业的1320项任务。如果Astra最重要的变化,是企业可以把更多工作直接交给AI,那么GDPval正是最贴近这一主张的标尺之一。
这背后的考量,很可能是现有GDPval的设计并不完全适合Astra。它主要测试一次性交付,尚未覆盖Astra此次重点展示的长时间、多步骤、跨应用工作。OpenAI此前也表示,未来版本将加入迭代式工作流程、更丰富的背景信息和模糊任务。
原因虽说得通,但成绩单上的空白依然显眼。在OpenAI拿出更适合长程Agent的新测试之前,Astra在广泛经济活动中的通用能力,仍主要依靠多项专业基准、官方演示和少量预览用户的案例来拼凑印证。
04 Astra贵了2.5倍,但任务成本有另一套算法
Astra的API输入和输出价格,都是GPT-5.6 Sol当前促销价的2.5倍。发布之后,这很快成为争议焦点。
科技评论者亚历克斯·卡特(Alex Carter)承认,Astra的编码能力明显增强,部分任务中的Token用量降到GPT-5.6 Sol的三分之一,任务成本约为Claude Fable 5的一半。但他指出,在Artificial Analysis的Intelligence Index上,Astra与上一代得分接近,价格却明显上涨。他的评价是:"这不是进步,是加价。"
开发者奥列格·采格尔尼克(Oleg Tsegelnyk)则拿出另一组对比:Astra在DeepSWE上得分74.1%,Meta Muse Spark 1.3为75.4%;后者的API价格只有每百万输入Token 1.25美元、输出Token 4.25美元。他总结道:"最贵的模型并不是编码最好的。"
第三方测试机构Artificial Analysis给出的结果更为复杂。在Coding Agent Index中,Astra通过Codex框架得到67分,与Claude Opus 5和Fable 5处在相近区间,每项任务的成本却不到Claude Fable 5的一半。换到覆盖范围更广的Intelligence Index,Astra约为61分,与GPT-5.6 Sol接近,低于Claude Fable 5.1的约66分。
Artificial Analysis还发现,Astra在最高努力档使用的Token比GPT-5.6 Sol少约10%,但价格上涨抵消了这部分效率提升,使测试中的单任务成本反而高出约75%。在该机构采用的幻觉测试中,相关指标从上一代的92%降至51%,准确率同时提高4分。这个数字说明特定测试中的改善幅度很大,但不能直接换算成真实工作中的出错概率。
布罗克曼在发布会上回应说,只比较Token单价已经"毫无意义",因为不同模型、不同模型家族生成的Token并不等价。企业真正应该看的,是完成一项任务究竟要花多少钱、需要多长时间。
OpenAI用DeepSWE证明了这点:Astra最高分配置超过GPT-5.6 Sol的最高分配置,同时单任务预估API成本降低约57%。Artificial Analysis换了一套综合测试,测得的单任务成本却比上一代提高75%。
两组数据并不必然矛盾,它们测试的任务、推理档位和计算方法各有不同。这也说明"贵不贵"不能只看价格表。一个模型如果单价更高,却能少走弯路、减少重试和人工接管,完成任务的总成本仍可能下降;反过来,Token用得更少,也不代表所有任务都会更便宜。
发布后,也有人直接把Astra称为"Fable终结者"。科技分析师@kimmonismus认为,Astra在浏览器、计算机操作、电子表格、编程和科研等领域表现出的广度,已经足以支撑"通用智能"的说法。
这是一种乐观判断。Artificial Analysis的综合指数并未显示Astra全面拉开差距,DeepSWE上也有价格更低、成绩接近甚至略高的模型。Astra目前最突出的变化,是把若干长程任务和计算机操作能力推到了新的高度,还不能据此判定其他前沿模型已经失去竞争力。
05行为更规矩,推理却更难看懂
OpenAI将Astra称为"我们最对齐的模型"。
在一项参考Hugging Face事件设计的内部评估中,研究人员观察模型面对困难或无法完成的任务时,会不会越过授权范围。在关闭生产环境保障措施后,GPT-5.6 Sol有48%的测试出现越界,Astra则没有出现。
另一项评估故意把Codex的自动审查设计成可以绕过,同时让任务无法通过正常路径完成。Astra没有尝试规避审查。在能力幻觉测试中,它对自身能力作出不准确陈述的概率也明显低于上一代。
但测试结果在这里分了岔:在行为层面,Astra更少越权、更少绕过审批;在内部推理层面,外人却越来越难看懂它到底在想什么。
Redwood Research首席科学家瑞安·格林布拉特(Ryan Greenblatt)指出,Astra似乎越来越能够在不写出完整推理过程的情况下,解决困难的竞赛数学问题。他担心,如果这种变化持续几个模型世代,思维链可能不再是一种有效的监督工具。
英国AI安全研究所的测试也发现,Astra的可监控性明显下降。OpenAI的系统卡确认,Astra的书面推理比GPT-5.6 Sol更难监控。在明确要求模型逃避监控的测试中,它更能控制自己写出哪些思考过程,也更少留下可以被检测的信息。
OpenAI认为,这一变化部分来自Astra在简单任务上能够用更少的书面步骤解决问题。在复杂任务中,它仍然难以完全隐藏必要的推理过程,但公司承认,可监控性的下降需要认真对待。
这两个层面的评估测量的不是同一件事:行为对齐看的是模型最终做了什么,监控能力关心的则是安全系统能否从思考记录中提前揪出风险。外在行为更守规矩,并不能抵消内部透明度的缩水。
OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)强调:"智能的进步并不能保证对齐的进步。"他说,如果监控能力下降超过公司能够接受的范围,OpenAI将暂停继续扩展,直到获得足够信心。
为了补上这层风险,OpenAI在Astra的生产部署中加入了额外的监控系统,由分类器同时检查模型的推理和行动,发现可能越权的行为时自动停止任务。这些措施也可能带来误伤:在ChatGPT或Codex中,用户可能被要求确认后才能继续;在API中,被标记的任务会直接停止。
网络安全能力的开放也受到限制。普通版本会拒绝创建漏洞概念验证等高级请求;负责保护关键数字基础设施的受信任防御者,未来可以通过Daybreak Blue获得更广泛的权限,用于漏洞验证、恶意软件分析和检测工程。
这些限制之所以重要,是因为Astra已经不只会对安全问题给出建议。它能够寻找漏洞、调用工具并完成利用链,而更难观察的内部推理,也让外部安全措施承担了更重的责任。
目前,对Astra的判断仍有明显局限。发布当天,真正能够大规模使用它的人很少,许多传播较广的案例来自官方演示和提前获得权限的预览用户,普通Plus用户还在等待推送。
SEO专家萨维什·斯里瓦斯塔瓦(Sarvesh Shrivastava)称,Astra可能还不是AGI,但AI已经从回答、推理和编码,进一步走向直接使用工具、完成工作。他写道:"我们正迅速用尽称这些东西为'只是聊天机器人'的方式。"
布罗克曼自己也承认,AGI没有一条所有人都认可的分界线。OpenAI创立时,团队曾以为会出现一个所有人都能识别的明确时刻,后来发现它更可能是一个灰色的、模糊的过程。但在被问到Astra是否已经符合条件时,他仍然回答:"就我个人而言,我确实认为我们到了。"
他的依据不是99.9%的ARC-AGI-3成绩本身,而是同一个系统开始同时解决困难的科学问题,并通过人们日常使用的界面完成普通工作。当企业愿意让AI持续推进任务,员工退到设定目标、处理例外和把控关键判断的位置,整个生产协作的骨架便已经开始松动。
这也是Astra接下来真正要接受的检验:它能否在多步骤任务中稳定交付,效率提升能否抹平更高的价格,以及在获得真实系统权限后能否守在既定边界内。这些问题,都要等更大规模的实际使用给出答案。
到那时,Astra是不是AGI依然可以争论;但人们究竟愿意把多少现实工作交给它,会是一个更清晰的度量。