这项由月之暗面(Moonshot AI)研究团队完成的研究,以预印本形式发布于2026年7月27日,论文编号为arXiv:2607.24957,有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。
你有没有遇到过这样的情景:把一张照片发给某款AI助手,然后问它一个看起来再简单不过的问题——比如"图里有几棵树"或者"帽子是什么颜色的"——结果AI却给出一个离谱的答案?这种现象其实不是偶发的小故障,而是当前人工智能系统普遍存在的一个根本性短板:它们的"眼睛"其实并没有我们以为的那么好用。
月之暗面的研究团队专门为这个问题设计了一套测试,名叫PerceptionBench(感知能力测试台)。这套测试不考算术,不考历史知识,不考逻辑推理,只考一件事——你看到了什么?结果测试了十六款当今最顶尖的AI大模型之后,研究团队发现:没有一款AI的得分能超过60分(满分100分)。这个结论相当令人震惊,因为这些AI模型在其他许多复杂任务上早已远超人类水平,但在最基础的"看图说话"层面,它们依然漏洞百出。
接下来,本文将带你完整了解这项研究做了什么、怎么做的、发现了什么,以及这一切对我们理解和使用AI意味着什么。
一、为什么"看图"对AI来说这么难
要理解这项研究的价值,得先搞清楚一个背景:现有的AI测试,大多数都是"一锅炖"。
考虑这样一个场景:你出了一道题给学生,问"根据这张仪表盘的图片,这辆车还能跑多少公里"。这道题要求学生既能看懂指针指向(视觉能力),又要知道油箱容量和油耗的关系(背景知识),还要做一个简单的数学计算(推理能力)。如果学生答错了,你能断定他是哪里出了问题吗?答不上来。也许他数学很好、知识也充分,只是没看清楚指针的位置而已。
这正是当前AI测试领域面临的困境。像MMMU、MathVista这类广受好评的综合测试,它们考的是多步骤、跨能力的复杂问题,答对了说明整体能力强,但答错了,没人知道到底是哪个环节出了岔子。而另一类专项测试,比如专门考OCR(文字识别)能力的OCRBench,或者专门考图形界面定位的ScreenSpot,虽然更聚焦,但只能照到视觉能力这座冰山的某一个面。
月之暗面的研究团队把这个问题称为"感知能力的碎片化评估困境":现有的测试要么范围太宽、无法定位问题,要么范围太窄、无法全面覆盖。于是他们决定从头开始,专门建立一套只测"看"的能力的基准测试。
二、"从失败中学习":这套测试是怎么设计出来的
研究团队的思路非常有趣,他们没有坐在会议室里拍脑袋决定要测什么,而是先让AI"出丑",再从错误里归纳规律。
具体来说,他们收集了42个已有的视觉AI测试,涵盖了文档理解、图表分析、界面操作、科学图形、自然图片等各种场景,然后让一批顶尖的AI模型去做这些题,专门收集做错的案例。一共积累了超过9000个"失败案例"。
但光知道"答错了"还不够——研究团队需要搞清楚答错的原因。他们引入了一个更强大的AI模型作为"考官",让它逐条分析每一个答题失败的过程:AI在哪一步出了错?是看错了图?还是算错了数字?还是不知道某个专业知识?
这个过程有点像法医鉴定——不是说"这个人死了",而是要找出"死亡的确切原因"。考官AI会把每次失败追溯到最早的出错环节,按照一个"谁先错谁负责"的原则来定性。如果AI在读图阶段就搞错了画面里有几个物体,那不管后续的推理有多精彩,这个错误就归入"视觉计数失败",而不是什么推理失败。
经过大规模的错误收集与分类,研究团队整理出了一套由22种错误类型构成的错误分类体系。整个体系分为感知错误、推理错误、知识错误、前提错误和其他错误五大类。其中,与视觉感知直接相关的错误分出了整整10种,而且这10种错误几乎在每一个已有测试中都有出现——这说明它们是AI视觉能力的共性短板,而不是某个特定任务的特殊问题。
这10种视觉感知能力分别是:视觉定位(找对位置)、视觉属性识别(认清颜色形状纹理等特征)、视觉计数(数对数量)、视觉关系理解(判断相对位置,如左右上下)、深度与三维感知(判断远近遮挡和立体结构)、OCR文字识别(读对文字)、视觉比较(比大小、比异同)、细粒度识别(区分相似物体的细微差别)、上下文整合(跨图像或跨区域汇总信息)、感知性幻觉(不在图里的东西,AI却"看到了")。
三、3000道题,每道只考一件事
有了这10种能力的分类框架,研究团队开始构建实际的测试题。他们的目标非常明确:每道题只考一种能力,答案简短清晰,没有歧义,难度来自"看"本身,而不是来自知识储备或逻辑推理。
题目来源有两类。一类是从原来那42个测试的错误案例中提炼出来的"子问题"——比如原来的题是"根据这张棋盘,白方被吃了几个子",研究团队会把它拆解成更原子化的问题,比如"棋盘上现在有几个白色棋子",这样就把计数能力单独剥离出来了。另一类是研究团队从网上搜集了新的图片,专门针对某种视觉能力重新设计原创题目。
为了防止题目太容易(没有区分度)或者太难(纯粹在为难AI),研究团队用了一个"难度过滤"机制:找来四个顶尖AI模型组成评审团,把每一道候选题都测一遍。如果四个模型全都答对了,说明这道题太简单,直接淘汰;只有那些让模型"有点困难"的题才能留下来,并按照通过率分成三个难度档次。
最终,经过专业标注员超过10人的人工核查,确认每道题的答案与图片内容一致、能力指向明确、没有歧义之后,3000道题正式构成了PerceptionBench。其中,10种能力各有几百道题,分布相对均衡:视觉定位、计数、属性、关系、深度各占330题,细粒度识别290题,视觉比较279题,上下文整合和OCR各255题,感知幻觉271题。
60%的题目是从现有测试的错误案例拆解而来,40%是针对新图片全新创作的。所有图片还经过了"污染检查"——用一种叫做ISC的图像相似度算法,对比了图片与AI训练数据集(如LAION和Common Crawl)的相似程度,相似度超过0.95的图片一律排除,以确保测试不会因为AI"见过"这张图而占便宜。
四、十六强对决:谁的眼力最好,谁又最容易"看见"不存在的东西
测试正式开跑,十六款当今最顶尖的AI模型参与了这场"眼力大赛",其中包括GPT-5.6-Sol、Kimi K3、Claude-Fable-5、Gemini-3.1-Pro等一系列家喻户晓的名字,覆盖了商业闭源模型和开源模型两大阵营。每款模型都使用了厂商提供的最高推理预算,力求展示最佳状态。
结果摆在面前,第一个触目惊心的事实是:没有一款模型的得分超过60%。表现最好的GPT-5.6-Sol得了59.7分,紧随其后的Kimi K3是58.5分,其他模型从57.2分一路往下排,最低的GLM-4.6V只有32.5分。换句话说,即便是全球最顶尖的AI,在只考"看图"这件事上,仍然有超过40%的问题答错。
第二个有趣的发现是,不同的视觉能力之间,AI的表现差距极大。整体来看,感知性幻觉(AI声称看到了图中根本没有的东西)是所有10种能力中平均得分最低的,各模型平均只有36.7%的正确率。相比之下,视觉关系理解的平均分是53.2%,OCR文字识别是52.4%,视觉定位是52%,都远高于幻觉能力。
更耐人寻味的是,总分高的模型,在某些单项能力上反而不如总分低的模型。最典型的案例是GPT-5.6-Sol:它是总分冠军,在视觉定位上得了76.7的高分,但在感知幻觉这一项,它的得分只有26.9%,不仅是自己的短板,也是整个排行榜上倒数最低的几个分数之一。反观总分排在中游的Gemini-3.5-Flash,幻觉能力得了50.6%,是所有模型中最高的。
这种现象背后有一个合理的解释:那些被训练得"更勇于给出答案"的AI,往往会倾向于在画面中"找到"一些其实并不存在的内容,以确保自己总有东西可以回答。这种积极的答题姿态在大多数题目上是有帮助的,但在专门考察"图中是否存在某物"的幻觉题目上,就会适得其反——这类题的正确答案恰恰是"没有",而过度自信的AI偏偏会说"有"。
总分相近的模型之间,能力画像也可能截然不同。GPT-5.5得了55.8分,Gemini-3.1-Pro得了56.2分,两者只差0.4分,看起来旗鼓相当。但细看各项能力,GPT-5.5在视觉定位上比Gemini-3.1-Pro高了整整13分(65.8对52.7),而Gemini-3.1-Pro在OCR文字识别上比GPT-5.5高了近8分(64.3对56.5),在细粒度识别上也高了约8分(54.8对47.2)。如果只看总分,你会以为这两款AI差不多,但它们其实有非常不同的视觉能力结构。
开源模型方面,Kimi K3的表现令人瞩目——它以58.5分排在所有十六款模型的第二位,超过了除GPT-5.6-Sol之外所有的商业闭源模型。这说明开源AI在视觉感知领域的追赶速度相当可观。
五、测试稳定吗?AI今天答对明天就一定还对吗
研究团队还考察了一个很多人可能忽略的问题:这些测试结果可靠吗?AI每次做同样的测试,会不会得到不同的成绩?
他们对GPT-5.6-Sol、Gemini-3.5-Flash和Kimi K3三款模型,各独立运行了四次相同的测试。结果显示,每款模型的四次总分之间波动极小——Kimi K3四次得分分别是58.2、58.2、58.8、58.7,标准差只有0.32,说明总体成绩非常稳定,不会因为随机性而大幅变动。
但有趣的现象出现了:研究团队还计算了"至少答对一次"和"四次全都答对"这两个指标。Kimi K3的"至少一次"得分高达73.9%,但"四次全对"只有42.7%。这中间超过30个百分点的差距意味着什么?意味着有相当一部分题目,AI今天能答对,明天就未必了。从宏观统计角度看成绩是稳定的,但在具体的每一道题上,AI的表现却是飘忽不定的。
这说明当前AI的视觉感知能力,很多时候并不是真正"掌握"了某项能力,而更像是一种带有随机性的"碰运气"——有时候蒙对了,有时候蒙错了,整体上因为大数定律而显得稳定,但每一道题的底层感知过程实际上并不可靠。
六、真实题目长什么样
为了让这套测试不那么抽象,研究团队展示了一批具体题目样例,读完会让人对AI的"视觉盲区"有更直观的感受。
在视觉定位方面,有一道题是给出一张星盘图案,问"双子座的符号在几点钟方向",答案是6点钟方向。在视觉属性方面,有一道题是给出一张书桌图片,问"桌上两个带粉色的笔筒,哪一个是纯粉色的,哪一个是灰粉拼色的"。在视觉计数方面,则有"图中红色框内有几朵花的主体在框内"这类问题。在感知幻觉方面,有一道题最为典型:给出一张办公室图片,问"图中有几张白色桌子",正确答案是0——图里根本没有白色桌子,但很多AI会自信地报出"1"或者"2"。
这些题目乍看简单,却专门针对AI最容易犯错的地方设计。研究团队还展示了一些"原题拆解"的案例,把一道多步骤的原始题目分解成几个子问题,然后看顶尖模型在这些子问题上的表现。结果发现,即便是总分很高的模型,在被拆解出来的单纯感知子问题上,依然频频出错。失败往往发生在最基础的感知层面,而不是更高层的推理层面——这正是研究团队想要证明的核心论点。
七、这套测试本身是否具有代表性
研究团队内部还保留了一个更大的题库,包含超过17000道验证过的题目。公开发布的3000道题只是从这个大库中按照能力均衡和难度分层的原则抽取出来的。
为了验证这3000道题是否真的能代表大库的整体水平,研究团队对比了两者的每项能力得分。统计分析显示,两者之间的皮尔逊相关系数达到0.84,说明相关性非常高——在大库里表现好的能力,在小库里也表现好;在大库里的弱项,在小库里同样是弱项。而且大库整体比小库略难一点点,说明公开版本在难度分布上稍微做了一些平滑处理,但基本特征得到了很好的保留。这意味着用这3000道题进行评测,花费的成本不到完整测评的五分之一,但结论的可靠性基本不受影响。
说到底,这项研究揭示的是一个看似矛盾、实则深刻的现实:AI正在变得越来越"聪明",能写论文、能做题、能编程,但在"睁开眼睛好好看一看"这件事上,它们还差得很远。PerceptionBench就像是一张专门测"眼力"的视力表——不考其他的,就考你能不能准确地感知到画面里真实存在的内容。而结果表明,最顶尖的AI在这张视力表上,也只能勉强达到"及格线以下"的水平。
这对我们普通用户来说意味着:当你用AI分析图片时,它给出的答案可能看起来头头是道,但如果它在最基础的感知层面就搞错了信息,那后面的分析不管多精彩,都可能建立在错误的基础之上。了解这一点,能帮助我们更清醒地使用AI工具,对它的输出保持适度的批判性判断。
对于AI研究者来说,这套测试提供了一把手术刀式的诊断工具——可以精确定位一个模型在哪种视觉能力上有短板,而不是只能笼统地说"这个模型视觉能力比那个弱"。PerceptionBench的完整代码和数据已公开发布,任何研究者都可以用它来测试和改进自己的模型。
有一个思考题或许值得你进一步琢磨:如果连最顶尖的AI在看图这件事上都还如此不可靠,那些依赖AI进行图像分析的应用场景(比如医疗影像辅助诊断、自动驾驶感知、工业质检)的安全边界究竟在哪里?这或许是比"AI能不能答题"更重要的问题。
有兴趣深入了解这项研究的读者,可以通过arXiv编号2607.24957查阅完整论文。
Q&A
Q1:PerceptionBench测试的是什么?
A:PerceptionBench是月之暗面(Moonshot AI)设计的一套专门测试AI视觉感知能力的基准测试,不考知识和推理,只考AI能否准确"看懂"图片。它将视觉感知拆分为10种原子能力,包括物体计数、颜色属性识别、文字识别、深度判断等,共3000道题,每道题只考一种能力,答案简短无歧义。
Q2:为什么顶尖AI在PerceptionBench上得分不到60%?
A:因为PerceptionBench专门针对AI的视觉感知短板设计,过滤掉了所有"太简单"的题目,只保留对当前顶尖模型有区分度的难题。AI在复杂推理和知识任务上表现很强,但在单纯的图像感知层面存在系统性弱点,比如数错数量、看错颜色、或者"看见"了图中根本不存在的物体。
Q3:感知性幻觉是什么,为什么AI总分越高幻觉反而越严重?
A:感知性幻觉指AI声称在图片中看到了根本不存在的内容。总分高的模型往往被训练得更"勇于给出答案",这种积极的风格在大多数任务上有益,但在"图中没有某物"的题目上反而会答错,因为它们倾向于把不存在的东西也"认"出来。
热门跟贴