OpenAI 在 X 平台发布了一组新数据:GPT-6 Astra 在四项不同领域的基准测试中全部拿下 SOTA(当前最优)成绩。这四条线分别是数学推理、抽象推理、终端任务和科学发现——覆盖面之广,在近期的模型发布里不多见。
具体成绩单是这样的:
- FrontierMath Tier 4:数学推理,挑战高难度竞赛级问题
- ARC-AGI 3:抽象推理链,考察模型从少量样例中归纳规律的能力
- TerminalBench-4.0:终端/计算任务,模拟真实操作环境中的执行能力
- Terminal-Bench Science 0.1HealthBench Pro:两项科学导向基准,分别覆盖科研场景和医疗健康评估
这组数据的特别之处在于,它没有把鸡蛋放在一个篮子里。数学和科学推理通常考验模型的逻辑深度,而终端任务更看重工具调用和代码执行的实用性。GPT-6 Astra 在这两类性质不同的任务上同时登顶,说明它的能力不是单点突破,而是横向铺开的。
为什么这次值得关注?
过去一年,各家模型在单一基准上刷分并不稀奇,但能在横跨数学、推理、计算和科学四个维度的测试中同时保持领先,意味着模型的基础能力更均衡。尤其是 ARC-AGI 3 这类设计用来衡量"通用智能"的测试,分数提升往往比传统 benchmark 更难。
当然,基准测试只是参考系。真实世界里的复杂问题,往往比这些测试集更混乱、更开放。GPT-6 Astra 在实验室里的表现能否转化为实际生产力,还需要看它在真实工作流中的表现。不过至少从这份成绩单来看,OpenAI 这次拿出的东西,确实有点东西。
热门跟贴