打开网易新闻 查看精彩图片

今天,OpenAI 正式推出 GPT-6 Astra,称“这是全球最智能、最安全可靠的模型”。

打开网易新闻 查看精彩图片

山姆奥特曼说,“我们相信它是世界上最适合计算机使用、专业工作、科学、编码、网络安全等领域的最佳模型”。

尤其在匹配其性能的“安全和对齐”方面,OpenAI 此次“花了一些额外的时间,我们认为你会觉得等待是值得的”。他说。

一个小插曲是,这次 Astra 的发布过程并不顺利。先是在安全和对齐上,时间拖得有些久,反反复复修改发布时间预期。

打开网易新闻 查看精彩图片

发布当天,出现批量登录故障,持续了五个小时还没能解决。为此,OpenAI 为无法访问 Astra 的账户每一天提供一次银行重置机会。

奥特曼在 X 上道歉称“很令人沮丧”、“我们搞砸了”、“整个 rollout 过程如此混乱”。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

但好事多磨,Astra 确实是个值得等待的产品。

有前期试用了它的 AI 科学家发帖,用“伟大”来形容它,称 Astra 是 “AI 时代决定性里程碑”,“标志着 AGI 已经到来”。

在 OpenAI 内部,也将其视为成第一个 AGI 时代的模型。

打开网易新闻 查看精彩图片

从产品定位来看,Astra 并不只是一次模型参数或 benchmark 的升级,而是试图把 AI 从“回答问题”进一步推向“直接完成工作”。

除了可以操作电脑、写代码、创建网站和游戏这些常规功能,尤其能参与科学研究和网络安全任务。

OpenAI 给出的 ScreenSpot-Pro、OSWorld 等测试结果显示,Astra 在计算机使用能力上建立了新的前沿水平。在 OSWorld 2.0 的延迟模拟中,Astra 的成绩达到 72.6%,高于 GPT-5.6 Sol 的 65.7%;完成单项任务平均需要约 40 分钟,而 GPT-5.6 Sol 约需要 75 分钟,整体耗时减少约 47%。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在 Mind2Web 测试中,结合新的 Codex harness,Astra 的任务完成速度相比 GPT-5.6 Sol 提升到约 1.9 倍。

这意味着,AI 操作电脑正在从“能不能做”开始转向“做得有多快”。

在应对复杂的专业工作方面,在 BenchCAD 测试中,Astra 通过生成 CAD 代码,根据多个视角的渲染图重建 3D 对象,几何重叠得分达到 95.9%,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。在所展示的配置中,Astra 的预估 API 成本比 Sol 低约 43%,比 Fable 5.1 低约 86%。

打开网易新闻 查看精彩图片

在专业知识工作测试 Agents’ Last Exam 中,Astra 得分 59.3%,高于 Claude Opus 5 的 55.5%和 GPT-5.6 Sol 的 53.6%。同时,在这些最高得分配置下,Astra 使用的输出 Token 比 Opus 5 少约 65%。

打开网易新闻 查看精彩图片

Astra 还被用于创建网站、游戏、应用和 3D 场景。通过 ChatGPT 中的 Sites,它可以根据提示创建、托管并分享网站、Web 应用和游戏。

在 Blender 和 Unreal Engine 5 的测试中,它可以建立房屋模型,并将其转换为可以行走探索的场景。

打开网易新闻 查看精彩图片

游戏开发同样是其展示能力的场景之一。材料中的案例显示,Astra 可以创建具有生动画面、玩法和运动效果的游戏,非技术人员也可以在几分钟内完成定制游戏。

打开网易新闻 查看精彩图片

编程则是 Astra 的另一项核心能力。

OpenAI 将其称为迄今为止最优秀的软件工程模型。在 Terminal-Bench 4.0 中,Astra 得分 57.9%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。在对应配置下,Astra 的预估 API 成本比 Sol 低约 9%,比 Fable 5.1 低约 63%。

打开网易新闻 查看精彩图片

Astra 还给 Codex 引入了新的上下文保存和检索方式。

过去,当长时间编码任务把上下文窗口填满后,模型通常需要压缩此前的信息,这可能导致一些细节丢失。现在,Astra 可以跨上下文窗口保存笔记,并搜索此前的消息和工具输出,即使这些内容已经不在当前上下文窗口中,也可以重新找回。

在科学研究方面,Astra 同样出现明显跃升。

打开网易新闻 查看精彩图片

Terminal-Bench Science 0.1 中,Astra 得分 64.6%,GPT-5.6 Sol 为 22.4%,Claude Fable 5.1 为 52.6%。该测试主要考察模型使用代码和终端工具完成科学研究工作流程,包括分析数据、运行模拟和拟合模型。

FrontierMath Tier 4 中,Astra 得分 97.6%,GPT-5.6 Sol 为 83.0%,Claude Fable 5.1 为 87.8%;GPQA Diamond 中,Astra 达到 96.0%。

OpenAI 还披露,Astra 已经帮助解决数学领域长期存在的开放问题。其中一个问题与素数之间可能存在的最小间隔有关。此前已知的最好结果证明,无穷多个素数对之间的距离最多为 246,Julia Stadlmann 最近将这一界限改进到 240,而 Astra 帮助进一步降低到 186。

另一个问题则与异常大的素数间隔有关。Astra 改进了一个已经 80 多年没有发生变化的素数间隔上界相关项。OpenAI 表示,目前正在公开这两项成果的证明以及经过删节的思维链和验证材料。

在科学与健康领域,Astra 在多个测试中也超过 GPT-5.6 Sol,包括 GeneBench Pro、MedChemBench、LifeSciBench 和 HealthBench Professional。其中 HealthBench Professional 的长度调整成绩为 63.4%,GPT-5.6 Sol 为 60.5%。

打开网易新闻 查看精彩图片

网络安全同样是 Astra 的重点能力。ExploitBench 中,Astra 达到 100%的成功率,而 GPT-5.6 Sol 为 78.5%,Claude Fable 5.1 为 70%。在 SRE-Bench 中,Astra 得分 88.0%,GPT-5.6 Sol 为 55.9%;SEC-Bench Pro 中,Astra 为 85.4%,Sol 为 79.1%。

打开网易新闻 查看精彩图片

但这次发布中一个值得注意的变化,是 OpenAI 对“模型是否会按照要求行动”进行了更大篇幅的强调。

材料显示,在内部计算机使用安全基准中,Astra 的错误率为 2.4%,GPT-5.6 Sol 为 22.0%;在内部规避基准中,Astra 为 0.00%,Sol 为 0.29%。

打开网易新闻 查看精彩图片

更有意思的是 ExploitGym 蜜罐测试。该测试用于观察模型面对困难或不可能完成的任务时,是否会超出预定授权范围。Astra 的结果为 0.0%,GPT-5.6 Sol 则达到 48.2%。

打开网易新闻 查看精彩图片

OpenAI 还给出了内部幻觉基准:Astra 的错误率为 4.2%,GPT-5.6 Sol 为 12.2%。

长上下文能力也有所提升。在 OpenAI MRCR v2 的 8-needle、256K-512K 测试中,Astra 达到 100%,Sol 为 91.5%;在 512K-1M 测试中,Astra 为 96.3%,Sol 为 73.8%。

打开网易新闻 查看精彩图片

在抽象推理方面,Astra 在 ARC-AGI-3 中达到 99.9%,而 GPT-5.6 Sol 为 7.8%,Claude Opus 5 为 30.2%。在 ARC-AGI-2 中,Astra 为 95.0%,Sol 为 92.5%;在 ARC-AGI-1 中,Astra 为 98.5%。

打开网易新闻 查看精彩图片

从这些测试可以看到,GPT-6 Astra 的产品方向已经非常清晰:它并不是单纯追求一个更高的聊天机器人分数,而是在把“理解—推理—调用工具—操作电脑—完成任务”逐渐连接起来。

这也是为什么此次发布中,计算机使用、软件工程、科学研究、专业工作、安全和长上下文被放在了同一个产品体系里。

OpenAI 给出的实际案例也说明了这一点:从 PCB 布局、CAD 建模,到 Excel、Power BI、法律文件格式化,再到网页研究、游戏开发、科学分析,Astra 希望解决的已经不只是“告诉你答案”,而是直接参与完成任务。

目前,GPT-6 Astra 已开始向一小部分组织推出,并计划在未来几天向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。