「欢迎来到 AGI 时代」
— OpenAI 总裁 Greg Brockman
刚刚,随着 GPT-6 的发布,我们真正的来到了新的时代
今天凌晨,OpenAI 发布了 GPT-6 Astra,在ARC-AGI-3 打到 99.9%,ExploitBench 打到 100%,FrontierMath Tier 4 打到 97.6%
难以置信,不可思议的数字
通过这个模型,你可以制作更为不可思议的场景、网站
这是通过 GPT-6 Astra 制作的游戏,我进行的实况录制
GPT-6 Astra 这款模型,今天开始向一小部分组织开放;
未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也会通过 OpenAI API 和 AWS 提供。
价格与 Fable 保持一致:输入 $10/M 输出 $50/M
跑分
这里我把所有的跑分都放出来了,感受一下吧....
跑分对比上篇:Computer Use、专业工作、编程
跑分对比下篇:科学、网安、对齐、长上下文、抽象推理
工作能力
这个模型的各种能力,都被极大程度的加强了。这里有一些展示,相信很能说明情况
比如通过 Astra 在 KiCad 里做 PCB 布局布线(把电子原理图变成可制造的 PCB,放置元件、布线铜连接)
你可以让他通过现有的资源,去创造游戏
它可以替你处理各种繁琐任务,例如填写在线表格、更新 CRM 中的客户记录,以及整理日历,甚至进行复杂的数据分析
当然,谁能拒绝来一个超炫酷的 Excel World Championship
甚至,还可以操作 FreeCAD 去完成这种零件/设备的渲染
这个是不是看起来更震撼了
以及配合 Codex 的更新,在 Mind2Web benchmark 上整体任务完成速度比当前 Sol 体验快了 1.9 倍
我们上线当天就把 GPT-6 Astra 接入了 Devin 的 harness,在内部测试 benchmark 上达到了 SOTA。computer use、写作、代码库理解开箱即用就有提升:视频明显更容易跟,报告更清晰简洁
Silas Alberti,Cognition SVP Research
专业工作
OpenAI 说 Astra 在模板遵循、幻灯片排版、叙事结构上是他们做得最好的模型,能产出直接能用的文档、表格和演示文稿。比如这个海报就排版的很好看
Astra 的训练特别针对了「只提取相关上下文进输出,不重复无关信息」这件事
当指令有模糊的地方,OpenAI 说 Astra 比前代更擅长自行判断。它用上下文填补常规空白,只在答案会实质性影响结果时才提问。在 Codex 里可以异步提问,同时继续不依赖回复的工作
Astra 在能力和效率上都给了我们显著优势。它能成功执行我们最复杂的创意工作流,同时 token 用量比其他测试模型少了最多 20%
Alex Mashrabov,Higgsfield AI CEO
写代码
从跑分上来看,GPT-6,也就是 Astra 是目前最好的模型了
同时,随着这次模型更新,Codex 里也新加了一个实验性功能:上下文窗口用完时 Astra 可以做笔记,之前的窗口内容可以回搜,不用每次都压缩进一份摘要
GPT-6 Astra 在我们内部 coding benchmark 和交易直觉 eval 上都比 Sol 有明显提升。agentic coding 时沟通方式更容易跟,代码到生产质量所需的迭代更少
John Crepezzi,Jane Street AI Assistants
Astra 在复杂法律任务上比 Sol 有显著质量提升,能像讲究的律师一样区分文件记录、发现未支持的假设、把缺口转化为具体的起草方向
Niko Grupen,Harvey Applied Research 负责人
做科研
数学方向,这款模型也是相当不俗
同时,Astra 帮助取得了两个关于素数间隔的新结果
第一个是 short prime gaps:此前十多年最好的结果是无穷多对素数间距不超过 246,Julia Stadlmann 最近改进到 240,Astra 帮助推到了 186,证明有无穷多对素数之间的距离不超过 186
第二个是 large prime gaps:改进了一个 80 多年没动过的项。证明和验证材料已公开
安全&对齐
Astra 在 Preparedness Framework 下触达了网安领域的 Critical threshold
OpenAI 还单独做了一个 ExploitBench(2026 年 6-8 月)eval,用最近三个月的 20 个高危 V8 漏洞测。Astra 39.0%,Sol 5.5%。测试过程中 Astra 发现并利用了两个此前未知的 0day 漏洞,OpenAI 正在向维护方披露
专家评估发现,不加安全措施的 Astra 能在加固浏览器上利用未知漏洞实现任意代码执行,能做加固操作系统的提权
同时,OpenAI 也表示说 Astra 是他们对齐做得最好的模型,在 care、task boundaries、transparent communication 三个方面有实质提升
另外 OpenAI 同时提到:Astra 的书面推理比 Sol 更难被监控。原因是 Astra 在简单任务上能用更少的推理步骤解决问题,推理更内隐。复杂任务上仍然难以隐藏推理过程,但 OpenAI 说他们认真对待这个退步,可监控性是研究重点
多少钱,在哪用
这款模型今天开始向一小部分组织开放; 未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,用量包含在现有订阅额度里,可以额外买 credits
Pro、Business、Enterprise 还能用 GPT-6 Astra Pro 版本
模型同时也会通过 OpenAI API 和 AWS 提供
热门跟贴