一张模型评测榜单,第一名和第二名是GPT 5.6 Sol与Opus 5。看到这个排序,很多人第一反应是:这榜还能信吗?

榜单可信度被质疑

打开网易新闻 查看精彩图片

质疑的核心在于实际体验。有观点认为,GPT 5.6 Sol在真实世界里的基础能力,要明显强于Opus 5。如果榜单把两者排在前两名,却无法反映这种实际差距,那榜单的参考价值就要打上问号。

排名之外的隐忧

更关键的是,如果前两名都存在争议,那榜单其余部分的排序就更难让人放心。原文直接指出,这意味着整张图表的其余部分都是片面的。

当一个评测体系连头部模型的相对强弱都说不清楚,用户自然有理由怀疑:后面的名次,还有多少可信度?