9月3日,OpenAI发布GPT-6 Astra。Greg Brockman直接称其为AGI起点,说"未来回头看,可能就是这个模型"。这个判断够大胆,但更值得关注的是发布会背后那组数字——越权概率从48%降到0%,质数间隙上界从240压到186,网络安全测试首次触到Critical红线。
这些数字拼在一起,指向一个结论:Astra不是一次常规迭代,而是OpenAI在能力、安全、成本三个维度同时押注的旗舰模型。它到底强在哪,弱在哪,和Anthropic的Claude Fable 5.1比又是什么位置?下面按五个维度拆开看。
电脑操作:从"能看"到"能干"
电脑操作(Computer Use)是Astra首推的能力。演示覆盖了办公自动化到PCB布线、3D建模,速度提升明显。OSWorld 2.0延迟模拟中,Astra用40分钟完成,Sol需要75分钟;配合Codex框架后,Mind2Web速度达到Sol的1.9倍。
办公场景里,Astra能在现有模板下生成可直接使用的文档和PPT,不再堆砌无关信息。宝玉的解读里有一句很到位:"人在电脑上能做的,Astra基本都能做。"这句话听起来像宣传,但至少从演示看,操作链条的完整度确实上了一个台阶。
编程基准:领先,但不是全面碾压
编程能力是Astra的招牌,但OpenAI自贴的基准表需要理性看。Terminal-Bench 4.0得分57.7%,高于Fable 5.1的55.8%;但DeepSWE v1.1几乎与Opus 5持平,FrontierCode部分指标反而落后。
也就是说,Astra在编程上领先,但没到碾压级别。Codex新增的跨上下文窗口记笔记功能倒是实用,能缓解长会话信息丢失的问题——这对实际开发场景帮助不小。
网络安全:首个触到Critical阈值的模型
Astra是OpenAI第一个在Preparedness Framework里达到网络安全Critical阈值的模型。ExploitBench满分100%,Chrome V8零日漏洞发现成功率39%,对比Sol的5.5%是质的飞跃。
但这也带来限制:正常用户遇到漏洞利用请求会被直接拒绝,防御性工作需要申请专用版本,宽松版仅对Daybreak项目开放。能力越强,管控越严,这是Astra面对的现实。
对齐改进:越权概率归零,但监控更难了
对齐能力是这次提升最明显的地方。去掉安全措施后,越权概率从Sol的48%降到0%,Auto-review拒绝后也不会尝试绕过。这个数字变化,说明Astra在"不做不该做的事"上确实下了功夫。
不过双刃剑也在这:规避监控测试中,Astra的推理过程比Sol更难被监控。原因是它对简单任务的推理控制力更强,能用更少步骤完成任务——步骤少了,监控的抓手也少了。可解释性挑战,成了新问题。
数学科学突破,但综合智能仍落后
数学与科学是Astra的亮点。质数间隙上界从240压到186,FrontierMath Tier 4得分97.6%,ARC-AGI-3达99.9%。这些数字在数学和推理领域是实打实的突破。
但综合测试上,Astra还没全面领先。HLE(带工具)得分57.2%,落后Fable 5.1的65.0%;Artificial Analysis综合智能指数61.2,也低于Fable 5.1的65.7。单项强,综合弱,这个反差值得注意。
定价与定位:和Fable 5.1正面刚
定价上,Astra与Claude Fable 5.1完全一致:API为$10/M input、$50/M output。同样的价格,不同的能力侧重——Astra在电脑操作和网络安全上更强,Fable 5.1在综合智能指数上领先。
宝玉的解读里提到,Astra在HLE等综合测试仍落后Fable 5.1。这意味着OpenAI这次押注的不是全面超越,而是在特定维度建立优势。电脑操作、网络安全、数学推理,这三个方向选得很有针对性。
AGI宣言背后的真实差距
Greg Brockman说AGI已经到了,但数据告诉我们,Astra在综合智能上还没超过Anthropic的最新模型。越权概率归零、质数间隙突破、网络安全触线——这些是实打实的进步,但"AGI起点"的说法,更像一个宣言,而非既成事实。
对开发者来说,Astra和Fable 5.1同价不同质,选哪个取决于场景:要电脑操作和网络安全,选Astra;要综合智能和通用表现,Fable 5.1可能更稳。这场旗舰对决,才刚刚开始。
热门跟贴