这几天我看AI榜单看得有点勤。

几天前刚发过一次,当时还觉得,前几名已经挤得够厉害了。

结果再打开最新榜单,又变了。

Claude Opus 5最高档还是第一,63分。

Claude Fable 5,62分。

Grok 4.6和GPT-5.6 Sol都已经挤进61分这一档。

Kimi K3最高档到了60分,Qwen3.8这一代也已经做到58分左右。Artificial Analysis目前使用的 Intelligence Index v4.1.1,是把9类测试综合起来算的,并不是简单比一道题。

我盯着这几个数字看了一会儿。

突然觉得,现在AI榜单最好看的地方,已经不是“谁第一”了。

而是:第一名和后面的人,开始拉不开距离了。

打开网易新闻 查看精彩图片

如果放在一两年前,大家看AI新闻,经常会有一种感觉:

前面就是那几家公司。

后面的人想追,好像隔着一道挺高的墙。

现在这堵墙明显没以前那么高了。

Grok 4.6刚更新不久,就冲到61分。Artificial Analysis的测试里,它比上一代Grok 4.5直接涨了5分,而且已经和GPT-5.6 Sol处在同一档。

Kimi K3最高档也已经做到60分。

Qwen3.8和Claude Opus 5最高档之间,目前也就差5分,而且Qwen的使用成本明显低不少。

放在榜单上,就是几行数字。

但放到实际使用里,我觉得味道已经变了。

以前是:“到底哪个AI最厉害?”

现在更像:“这么多都挺厉害,我到底用哪个?”

这两个问题,看着差不多,其实完全不是一回事。

越来越有这种感觉。

刚开始接触这些工具的时候,我也会盯榜单。

第一名是谁?

哪个模型又超过谁?

国产模型排第几?

看得挺认真。

真用了一段时间以后,发现自己根本没那么忠诚。

写一段东西,这个顺手,我就用这个。

查资料,另一个结果更清楚,我就换过去。

碰到复杂一点的任务,哪个不容易中途跑偏,就让哪个干。

至于它到底排第一还是第三,有时候真的没那么重要。

说到底,我又不是给这些模型发奖杯。

我是想把手里的事情做完。

打开网易新闻 查看精彩图片

这让我想起以前买手机。

十几年前,大家特别爱看跑分。

手机一发布,先看处理器,再看安兔兔多少分。

差几万分,都能讨论半天。

后来手机性能普遍够用了,很多人慢慢不看这些了。

真正影响选择的,反而变成:

电池耐不耐用。

系统顺不顺。

拍照怎么样。

价格合不合适。

AI现在可能也正在走到这个阶段。

当第一名63分,第二62分,后面61、60……

对普通用户来说,这几分到底能不能在日常使用里明显感觉出来?

未必。

但谁回答更稳定、谁更便宜、谁更懂中文、谁做自己那类工作更顺手,这些区别反而每天都能碰到。

所以我现在看AI榜单,会多看一眼,但不会再把第一名当成唯一答案。

还有一点,我觉得挺有意思。

以前一家模型更新,新闻可以热闹很久。

现在更新速度快到什么程度?

Artificial Analysis最近的更新记录里,8月份几乎隔几天就会出现新的模型评测或者版本变化。

今天61分。

过几天可能又有人62。

再过一个月,63分也未必还能待在第一。

这才是现在最有意思的地方:

“领先”这件事,正在变得越来越短。

以前领先一次,可能吃很久。

现在领先几个月,都算挺久了。

打开网易新闻 查看精彩图片

站在普通人的角度,我其实挺喜欢这种局面。

不是因为我特别关心哪家公司赢。

恰恰相反。

是因为它们越挤,我们越有得选。

一家不好用,可以换。

一家太贵,可以换。

写文章这个好用,做表格另一个好用,那就都留着。

没必要非要给自己选一个“唯一正确答案”。

以前我们总问:

“哪个AI最好?”

以后这个问题可能会越来越没意义。

更实际的问题反而是:

你今天要干什么,哪个工具最适合把这件事干完?

榜单当然还会有人看。

我也会看。

但现在再看到“某某登顶”“某某反超”,我已经没以前那么激动了。

因为第一名只有一个。

可真正好用的工具,完全可以有很多个。

对普通人来说,这可能比谁长期霸榜更重要。