打开网易新闻 查看精彩图片

2026 年 9 月 4 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。

打开网易新闻 查看精彩图片

此次发布另一个受到关注的焦点,是 OpenAI 总裁 Greg Brockman 对 AGI 的表态。

打开网易新闻 查看精彩图片

在媒体吹风会上,OpenAI 总裁 Greg Brockman 承认,AGI,也就是通用人工智能,本身仍然是一个“模糊、灰色的概念”,但他认为,未来人们回头看时,可能会把 Astra 视为 AGI 到来的一个节点。

“我认为,现在我们已经进入 AGI 时代,并不是不合理的。”Brockman 表示。

当被问及 OpenAI 是否正式宣布已经实现 AGI 时,Brockman 并没有给出这一结论。

Brockman 表示,AGI 已经不再与 OpenAI 此前和微软协议中的某个合同触发条件绑定,而更多成为一种“使命或精神层面的概念”。

Brockman 称,是否认为 Astra 已经达到 AGI,可以由每个人自行判断;就他个人而言,他认为“已经到了”,但这只是一个开始。

媒体吹风会最后,Brockman 说道:“欢迎来到 AGI 时代。”

打开网易新闻 查看精彩图片

OpenAI 研究人员 Aidan Clark 表示,Astra 首次在得州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时也是 OpenAI 首个在训练过程中大量使用前代模型参与监督的模型。

这是 OpenAI 至今规模最大的一次模型训练。

相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。

打开网易新闻 查看精彩图片

不过,在目前竞争最激烈的编程能力上,Astra 并没有与其他头部模型拉开明显差距

编程得分升至 74.1%,但没有坐稳第一

在 DeepSWE v1.1 Agent 编程测试中,Astra 得分达到 74.1%,高于 GPT-5.6 Sol 的 70.8%。

打开网易新闻 查看精彩图片

不过,这一成绩并没有形成明确领先。

Meta 此前公布,Muse Spark 1.3 在最高推理设置下取得 75.4%;公开的 DeepSWE 排行榜中,Gemini 3.8 Flash 和 Claude Opus 5 的成绩也在 74% 左右。

打开网易新闻 查看精彩图片

DeepSWE v1.1 一共包含 113 项任务,Astra 与 Muse Spark 1.3 相差 1.3 个百分点,实际大致只对应一到两个任务。不同结果的误差范围也存在重叠,因此目前很难仅凭这一项测试判断哪款模型拥有绝对领先的编程能力。

OpenAI 自己公布的对比图没有纳入 Muse,同时采用了 Fable 5.1 的 67.4% 成绩,因此 Astra 在官方图表中的领先幅度,要比放到更广泛的同类模型中比较时更大。

ARC-AGI-3 得分 98.6%

相比编程测试,Astra 在其他专项任务上的提升幅度更大。

其中最突出的是 ARC-AGI-3,Astra 得分达到 98.6%。

不过,这一成绩需要结合测试方式来看。

OpenAI 在测试 Astra 时使用了 Responses API Harness,可以在多轮任务之间保留推理信息,并通过 Compaction 管理长上下文。

OpenAI 此前已经展示过,即使不改变底层模型,仅调整 Agent 系统和运行方式,也可能大幅提高 ARC-AGI-3 的成绩。

因此,这项 98.6% 的结果反映的是 Astra 与 OpenAI Agent 系统结合后的整体表现,而不能简单理解为基础模型本身取得了 98.6%。

Astra 在 FrontierMath Tier 4 上还取得了 97.6% 的成绩。

打开网易新闻 查看精彩图片

这一结果覆盖了 Tier 4 共 43 道题中的 41 道私有题目。负责运行 FrontierMath 的 Epoch AI 表示,OpenAI 为该 benchmark 的开发提供了资金,同时拥有其中部分内容的独家访问权限,因此这一背景也需要纳入对成绩的判断。

CAD 重建得分达到 95.9%

在 BenchCAD Vision2Code 测试中,Astra 得分达到 95.9%。

BenchCAD 要求模型根据渲染图重建 CAD 程序,并根据生成的 3D 模型与原始模型之间的几何重合程度进行评分。

在包含 1000 个 CAD 文件的 Vision2Code 子集中,Astra 配合 Python 工具得分为 95.9%,Fable 5.1 为 84.3%,GPT-5.6 Sol 为 83.3%。

OpenAI 同时指出,Claude 的测试使用了经过修改的评测设置,因此不同模型之间不能完全直接比较。

但仅与 GPT-5.6 Sol 相比,Astra 在这一任务上的提升幅度依然较大。

在 Terminal-Bench Science 科学 Agent 测试中,Astra 得分达到 64.6%。

打开网易新闻 查看精彩图片

该测试要求 Agent 使用命令行完成来自 5 个科学领域的 70 项研究任务。Anthropic 此前公布 Fable 5.1 的成绩为 52.6%,而现有公开排行榜中,Opus 5 的最高成绩约为 30%。

OpenAI 和 Anthropic 都在尝试将模型从回答科学问题,推进到直接参与科研工作流程。

Codex 开始解决长任务中的“上下文丢失”

对于开发者来说,Astra 在 Codex 中一个更实际的变化,是处理超过上下文窗口的长任务。

目前 Codex 主要依赖 Compaction,将此前的工作压缩成摘要,为后续任务腾出上下文空间。

这种方式可能会丢掉后续仍然需要的重要细节,例如此前某个修复为什么失败、哪些测试已经执行过,或者用户在任务开始时提出过哪些要求。

Astra 可以跨上下文窗口保存笔记,并重新搜索此前的消息和工具输出,而不是完全依赖压缩后的摘要。

这一功能目前仍处于实验阶段,需要通过 config.toml 手动开启。OpenAI 表示,未来数周内计划将其变成 Astra 在 Codex 中的默认功能。

Astra 还可以在向用户提出问题后,继续执行那些不依赖用户回答的工作,而不是因为一个待确认问题让整个任务停下来。

OpenAI 展示了 Astra 操作 KiCad、Excel、Blender 和 Power BI,同时还展示了浏览器表单填写和网站 QA 等任务。

在 OSWorld V2-Offline 桌面应用测试中,Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%;平均完成一项任务所需时间则从约 75 分钟缩短至 40 分钟。

Anthropic 此前公布 Fable 5.1 在 OSWorld 上取得 77.9%,但 Anthropic 同时表示,其使用的是不同版本的 OSWorld,因此不应该与此前公布的成绩直接比较。

OpenAI 还调整了 Codex 的 Harness。在 Mind2Web 测试中,Astra 配合新的 Harness 后,完成任务的速度达到目前 Sol 版本 Codex 的 1.9 倍。

API 输入 10 美元,输出 50 美元

Astra 上线 API 后,每 100 万输入 Token 收费 10 美元,每 100 万输出 Token 收费 50 美元。

这一价格约为 GPT-5.6 Sol 当前促销价格的 2.5 倍,与 Anthropic Fable 5.1 的定价相同。

相比之下,Muse 的标准价格为每 100 万输入 Token 1.25 美元、输出 Token 4.25 美元;Google Gemini 3.8 Flash 的首发价格为输入 0.75 美元、输出 3.75 美元。

不过,更高的 Token 单价并不一定完成一项任务的最终费用更高。如果模型能够以更少步骤完成任务,同时减少重试,总成本仍有可能下降。

OpenAI 表示,在多项评测和合作伙伴测试中,Astra 完成任务所消耗的 Token 更少。

Brockman 对此表示:“真正重要的是完成一项任务的价格。”

网络安全能力达到 Critical 级别

Astra 的另一项重要变化来自网络安全能力。

打开网易新闻 查看精彩图片

OpenAI 表示,Astra 已经跨过其 Preparedness Framework 中的 Critical 网络安全能力门槛,成为 OpenAI 首个达到这一等级的模型。此前 OpenAI 已因为 Astra 可能达到这一等级而收紧测试和访问限制。

在 OpenAI 的测试中,Astra 已经能够针对经过加固的浏览器和操作系统开发漏洞利用程序。

在使用近期 V8 漏洞进行测试时,Astra 还发现了两个此前未知的漏洞。OpenAI 表示,正在向相关软件维护者披露这些漏洞。

不过,OpenAI 强调,其公布的高级网络安全测试成绩反映的是获得 Daybreak Blue 权限后的 Astra,而不是普通用户默认能够使用的生产版本。

在 ExploitGym 测试中,Astra 得分为 42.4%,GPT-5.6 Sol 为 30.3%。

打开网易新闻 查看精彩图片

但此次 OpenAI 取消了通常存在的 6 小时时间限制,因此这一成绩不能简单与此前结果横向比较。

在 ExploitBench 上,两款模型的成绩均达到 100%。

通过普通方式使用 Astra 的用户,将无法直接使用部分高级网络安全能力,包括部分漏洞发现任务。

OpenAI 首先会向经过审核的安全防御人员提供限制更少的访问权限,并计划通过 Daybreak Blue 在未来数周扩大开放范围。

Daybreak Blue 并不是一个单独的 Astra 模型,也不是特殊推理模式,而是一套面向获得授权的防御性网络安全工作的访问机制。

对于 API 用户,一旦网络安全安全检查被触发,任务会直接停止,而不是暂停并等待批准。

OpenAI 的 Mia Glaese 还提醒,可信访问项目之外的用户,在进行网络安全工作时可能遇到速度下降、暂停或任务被拦截的情况,有时甚至可能影响与网络安全无关的任务。

“在发布初期,用户应该预期会出现这种情况。”她表示。

模型更强,但也更难监控

OpenAI 将 Astra 称为其“最对齐”的模型。

在一项内部测试中,当模型面对本身无法完成的任务时,Astra 擅自超出授权目标范围的比例为 0%,而 GPT-5.6 Sol 为 48.2%。

不过,OpenAI 同时说明,对比中的旧模型是在“没有生产环境安全防护”的情况下运行,因此两组数字不能直接比较。

与此同时,OpenAI 还披露,Astra 的书面推理过程比 Sol 更难监控。

在专门设计用于诱导模型规避监控的评估中,Astra 的可监控性有所下降。OpenAI认为,这可能部分因为 Astra 在简单任务中对是否写出完整推理拥有更大的控制权,同时完成任务所需要显式写出的推理步骤也更少。

OpenAI 首席科学家 Jakub Pachocki 表示:“智能水平的提升,并不保证对齐能力也会同步提升。”

他还表示,如果 OpenAI 无法重新获得足够的信心,确保未来模型仍然能够被有效监控,将暂停继续扩大模型规模。

首批向 Daybreak 企业客户开放

Astra 发布后不会立即向所有用户开放。

首批使用者是已经通过 OpenAI Daybreak 项目获得访问权限的企业客户。

OpenAI 表示,未来数日内,Astra 将陆续向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时进入 OpenAI API 和 AWS。

打开网易新闻 查看精彩图片

其中,Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 的访问权限。符合条件的 API 客户则可以在 Zero Data Retention 模式下使用 Astra。

与 GPT-5.6 一次推出 Luna、Terra 和 Sol 多档型号不同,OpenAI 目前没有公布 GPT-6 的其他版本,现阶段产品线只有 Astra 和 Astra Pro。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片