OpenAI的GPT-6 Astra在Epoch Capabilities Index(ECI)上以166分排在首位,领先Anthropic的Claude Fable 5.1(164分)和OpenAI自家的GPT-5.6 Sol(162分)。但这一综合排名掩盖了一些复杂性:其Math-ECI达到170,创下新纪录,而在软件工程基准上,Astra的SWE-ECI为164,仍落后于Fable 5.1的167。
综合、数学与软件工程ECI分数(含90%置信区间)
ECI是Epoch做的一个综合能力衡量指标。这次比较了四个模型:GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol,还有Moonshot的Kimi K3。
综合分上,GPT-6 Astra为166.31,Claude Fable 5.1为164.47,GPT-5.6 Sol为161.81,Kimi K3为157.63。
拆开看,ECI还做了两个领域版本:Math-ECI和SWE-ECI。它们是领域特定的ECI,仅基于某一个领域的基准重新拟合,衡量模型相对于综合表现的实力。
- Math-ECI:GPT-6 Astra 169.83,Claude Fable 5.1 165.73,GPT-5.6 Sol 162.76,Kimi K3 158.39
- SWE-ECI:Claude Fable 5.1 167.44,GPT-6 Astra 163.58,Kimi K3 161.54,GPT-5.6 Sol 160.47
数学赛道,Astra领先第二名4分多。软件工程赛道,它落后Fable 5.1将近4分。
169到166,分数是怎么掉下来的
Epoch提到一个细节:基于发布前的评估,他们当时给Astra的ECI是169。但发布之后,随着更多软件工程基准结果出来,这个数字回落到了166.31。
对比表里能看到这个过程。2026年9月3日的快照上,GPT-6 Astra的ECI是169.23,当时只用了1个SWE基准(MirrorCode)。到了9月15日,ECI变成166.31,SWE基准增加到了4个:MirrorCode、WeirdML、DeepSWE、FrontierCode。
Claude Fable 5.1走的是反方向。9月3日它的ECI是162.88,只用了1个SWE基准(FrontierCode);9月15日升到164.47,SWE基准增加到3个:MirrorCode、WeirdML、FrontierCode。
一个往下修,一个往上修。基准覆盖越全,软件工程这一项对综合分的影响就越藏不住。
数学的样本,和代码的样本
两个领域的基准数量也不一样。Math-ECI这边,四个模型都只用了4个基准。SWE-ECI这边,GPT-6 Astra用了4个,Claude Fable 5.1用了3个,GPT-5.6 Sol用了6个,Kimi K3用了5个。
换句话说,Astra在数学上的领先,是在一套相对集中的题目上打出来的;而它在软件工程上的位置,是在基准不断补齐之后被重新校准的。
置信区间里的余地
看数字不能只看点估计。SWE-ECI这一项,GPT-6 Astra的90%置信区间是160.42到169.82,Claude Fable 5.1是161.95到178.53。Math-ECI那边,GPT-6 Astra是165.98到175.37,Claude Fable 5.1是162.84到175.91。
热门跟贴