这项由山东大学、山东省千佛山医院及中国科学技术大学联合开展的研究,于2026年7月发表在预印本平台arXiv上,论文编号为arXiv:2607.16609。研究的核心问题说来并不复杂:那些最新、最强大的AI视觉系统,真的能像眼科医生一样"读懂"一张眼底扫描图吗?
你大概有过这样的经历:去医院做眼科检查,医生会让你把下巴放在一台仪器上,眼前出现一道绿色的扫描光,几秒钟后医生就拿到了一张看起来像黑白断层切片的图像。那就是光学相干断层扫描,英文缩写叫OCT。这种技术就像给眼睛的视网膜做了一次极其精细的"CT",能清晰呈现眼球后壁各层组织的细微结构,是医生诊断黄斑变性、糖尿病视网膜病变、视网膜静脉阻塞等一系列可能导致失明的眼病的核心工具。
眼科医生读懂这张图需要经过漫长的专业训练。他们首先要评估图像质量是否合格,然后辨认出视网膜各层的解剖结构,接着寻找异常的病变信号,判断病灶的位置、形态、性质,最终综合所有信息做出诊断,制定治疗方案,并在复诊时根据变化调整策略。这是一个从"看图"到"理解图"再到"根据图做决策"的完整思维链条。
近几年,以GPT-4o、Gemini为代表的多模态大语言模型(简单理解:既能看图又能对话的超强AI)横空出世,在很多视觉理解任务上表现惊艳。自然有人要问:这些AI在眼科这个高度专业的领域里,究竟表现如何?能不能承担辅助诊断的工作?
然而,在山东大学团队开始这项工作之前,学界并没有一个全面、系统的测试框架来回答这个问题。现有的测试要么只考察AI能否识别几种大类疾病,要么只做孤立的问答题,根本没有模拟真实临床解读OCT的完整流程。当一个AI答错了,你无法判断它是因为"没看清楚图"、"不懂解剖知识",还是"临床推理能力有缺陷"。这就好比一个学生考试不及格,你不知道他是因为没看清题目、不懂基础知识,还是解题思路有问题——三种原因的补救方式截然不同。
为了填补这个空白,这支团队构建了一个叫做OCT-Bench的测试集,并用它对20个代表性AI系统做了迄今最系统的评测。结果说明了一件让人既有些失望又值得深思的事情:目前最好的AI,在这场"眼科视力考试"中仍然勉强及格,而且越考越难的题目,它们的得分下滑得越厉害。
一、给AI出一套真正考验"眼力"与"医术"的题目
要评测AI读懂OCT图的能力,首先要搞清楚"读懂"这两个字包含哪些层次。山东大学的研究团队参照真实临床工作流程,把OCT图像解读能力分成了三个由浅入深的层次,好比一位学徒从进诊室到独立出诊要经历的三个阶段。
第一个层次叫"感知",考察的是最基础的视觉识别能力。就像一个刚接触OCT的医学生,首先要学会认出这是一张什么图、图上有没有标注框、标注框是什么颜色、病灶的形状大致是什么样的。这一层的问题包括:识别成像设备类型、辨认图上的标注框、描述病灶的形态轮廓与边界特征、判断组织的反光强弱、统计图中有多少个标注区域、比较两个区域谁大谁小、判断两个标注框的空间相对位置。这八类小任务对应的是"能不能看清楚图"的问题。
第二个层次叫"认知",考察的是将视觉信息转化为医学知识的能力。光能看清楚还不够,还要知道看到的东西是什么。这一层要求AI能识别被高亮标记的是视网膜的哪个解剖区域,能辨认特定的视网膜分层,能理解相邻层之间的位置关系,能对病变进行分类(比如判断积液是视网膜内积液还是视网膜下积液),能评估关键结构的状态(比如黄斑是否完整),能定位病变所在的解剖层次,以及能判断发现的异常与哪种疾病最相关、可能造成什么功能损害。这六类任务考察的是"能不能把看到的东西理解为医学意义上的知识"。
第三个层次叫"推理",考察的是综合运用图像证据和医学知识做出临床决策的能力。这是最高也是最难的一关,包括:根据图像做出最可能的诊断,判断疾病所处的分期,制定治疗方案(比如根据图像特征判断该选哪种药物或治疗手段),以及在随访时根据病情变化调整管理策略。这四类任务模拟的是一位眼科医生真正在诊室里要完成的工作。
三个层次合计产生了20个细粒度任务,涵盖了从"看图"到"懂图"再到"用图做决策"的完整链条。更重要的是,把这三个层次分开测试,一旦AI在某个任务上失败,研究者可以精确追溯失败发生在哪个环节,而不是把所有错误笼统归结为"AI不行"。
二、题库是怎么造出来的:一场五步走的精心工程
有了框架,还需要真实的题目。研究团队从七个公开眼科数据集里收集了4137张OCT图像,这些图像涵盖了正常眼底以及黄斑裂孔、年龄相关性黄斑变性、脉络膜新生血管、中心性浆液性脉络膜视网膜病变、糖尿病黄斑水肿、视网膜前膜、青光眼、视网膜动脉阻塞、视网膜静脉阻塞共九类疾病,同时带有标注框、分割掩码、层次标签等多种类型的标注信息。七个数据集来源于不同研究机构,疾病类型各有侧重,这种多样性保证了测试集不偏向某一类特定图像风格。
题目本身由AI辅助生成,但经过严格的人工把关。研究团队针对每个任务设计了专门的生成指令,把OCT图像、任务描述、标注信息以及从美国眼科学会(AAO)、中华医学会等权威机构指南和专业参考书中汇编的医学知识一起喂给GPT-4o,让它生成四选一的选择题。生成之后,先由GPT-4o自动检查题目质量、答案唯一性和图文一致性,再由领域专家人工逐一审核医学正确性、视觉可回答性、任务相关性和歧义性,不合格的题目会被修改或直接删除。
经过这套流程,最终形成了包含10076道题目的OCT-Bench,每道题都对应一张图像和四个选项,且有且只有一个正确答案。在题目分布上,研究团队也刻意控制了不同疾病类别、解剖区域、视网膜层次和病变类型之间的比例,避免某一类标签过度集中造成考试偏向性。
三、二十位"考生"各自的成绩单
测试对象包括三大类共20个AI系统。第一类是闭源的商业顶级模型,分别是GPT-5.4-mini、Gemini-2.5-flash和Grok-4-fast,这些是目前市面上综合能力最强的视觉理解AI。第二类是开源通用模型,涵盖Phi-3-Vision-128K、InternVL2.5的4B和26B两个版本、Qwen2.5-VL的7B和32B两个版本、Gemma-3-12B,以及LLaVA-1.5-13B和LLaVA-1.6-34B。第三类是医疗专业模型,包括HealthGPT-M3、MedGemma-4B、Lingshu-7B和32B两个版本、Hulu-Med-7B和32B两个版本、MediX-R1-8B、Fleming-VL-8B,以及HealthGPT-Pro-8B。所有模型在完全相同的零样本设置下接受测试,不做任何针对OCT的微调或提示示例。
总体来看,这场考试的通过线令人清醒。四选一随机猜答的理论分数是25%。成绩最好的GPT-5.4-mini得了62%的总分,排在第二的是Gemini-2.5-flash的60.5%,第三是医疗模型Hulu-Med-32B的58.4%。这意味着即便是目前最强的AI,每做100道题仍然有将近38道会答错。
更能说明问题的是三个层次之间的成绩落差。在感知层,GPT-5.4-mini拿到了75.8%的最高分;在认知层,Gemini-2.5-flash最高达到64.2%;而在推理层,全场最高分只有Hulu-Med-32B的42.9%,仅比随机猜测高出不到18个百分点。从感知到推理,最好成绩足足下滑了32.9个百分点,几乎是自由落体式的下坡。
这个规律在单个模型身上也清晰可见。GPT-5.4-mini在感知层遥遥领先,但一到推理层就只有38.5%;HealthGPT-Pro-8B在感知层与GPT-5.4-mini基本持平(72.4%对75.8%),但推理层只有29.9%,甚至低于一些规模更小的通用模型。这说明能"看清楚图"的AI,并不一定能"根据图做决策"。
四、细看每道题:哪里是真正的短板
二十个细粒度任务的成绩揭示了更多具体的能力图谱。
在感知层内部,任务难度差异悬殊。识别图像是否为OCT(任务T01)的平均正确率高达97.9%,识别图上标注框的颜色(T02)平均正确率也有97.6%——几乎所有AI都掌握这些基础识别能力。然而,描述病灶的形态(T03,比如判断一个病变是点状、团块状还是线状)的平均正确率骤降至23.4%,最高得分也只有45.4%。同样处于感知层的尺度感知(T07,判断哪个标注框更大,平均53.4%)和空间方位识别(T08,判断一个标注框相对于另一个的上下左右位置,平均51.9%)也明显偏低。这意味着AI虽然能认出OCT图,却无法精确描述图中结构的几何形状和空间关系——这就好比一个人能认出地图上有两个城市,却说不清楚哪个城市在哪个城市的北边,也不知道哪个城市的面积更大。
进入认知层,解剖识别的结构特异性偏差尤为突出。区域识别任务(T09)整体最高分达到97.4%,看起来成绩不错,但这个高分背后藏着很大的不均衡。当研究者把不同解剖区域的识别正确率单独拿出来看,视网膜整体识别的平均正确率有76.5%,而脉络膜(视网膜下方更深的一层组织)的识别正确率平均只有50.7%。有些模型在视网膜识别上超过80%,在脉络膜识别上却低于21%;而Lingshu-7B和Fleming-VL-8B则恰恰相反,脉络膜识别表现出人意料地好,视网膜反而不如其他模型。这种模式不像是真正理解了解剖结构,更像是每个模型各自记住了某些"常见答案",遇到不常见的区域就失手了。更难的层次识别任务(T10)平均正确率只有30.9%,最高也不过56.8%,说明现有AI对视网膜十层细微结构的辨认能力非常有限。
在推理层,疾病诊断任务(T17)最能体现问题所在。这道题的平均正确率只有30.1%,最高只有47.7%。把不同疾病类别的诊断准确率拆开看,黄斑裂孔(MH)和中心性浆液性脉络膜视网膜病变(CSC)的平均诊断准确率分别是58.4%和53%,相对较好。但对于年龄相关性黄斑变性(AMD),平均正确率只有16.7%;青光眼只有7.8%;视网膜动脉阻塞(RAO)只有5.5%;视网膜静脉阻塞(RVO)更是只有2.5%,和随机猜测几乎没有区别。这种类别间的巨大鸿沟暗示,AI之所以在某些疾病上表现尚可,可能更多是因为训练数据中这类疾病的图像特征比较显眼、容易记住,而不是真正掌握了鉴别诊断的思维能力。
疾病分期任务(T18)的情况则是另一番难堪——所有20个模型的得分都密集地聚集在25.8%到34%这个极窄的区间里,基本上只是在随机猜测的水平附近徘徊。这说明没有任何模型真正学会了如何根据OCT图像特征判断疾病所处的严重程度。治疗方案制定(T19)和随访管理(T20)的最高分分别是56%和50.9%,但平均正确率分别只有33.8%和33.9%,说明偶尔能给出正确临床策略的AI,并不能做到稳定可靠。
五、"专业模型"和"大模型"是解药吗
很多人可能会想:既然普通AI不行,用专门针对医疗数据训练的医疗AI岂不就解决问题了?研究结果给出的答案是:不一定。
医疗模型在某些特定能力上确实有优势。Hulu-Med-32B在推理层拿到了全场最高的42.9%,Lingshu-32B的认知层得分也高于同等规模的通用模型。但是,同属医疗模型的HealthGPT-M3和MedGemma-4B总分却比多个普通通用模型还低,前者的总体得分只有45%,后者只有42.2%。医疗专业训练似乎能强化某些特定能力,但并不能保证全面均衡的OCT理解能力。
模型规模扩大会带来进步吗?同样是部分有效、但不全面。在同一家族内部比较,从7B参数扩到32B参数,总体准确率确实会提升,这在Lingshu和Hulu-Med两个系列中都得到了验证。但仔细看每个层次,扩大规模的收益分布非常不均匀。以Lingshu为例,从7B到32B,认知层提升了14个百分点,感知层却略有下降,推理层只提升了1.2个百分点——规模扩大对临床推理能力几乎没什么帮助。Qwen2.5-VL系列也有类似的规律。
闭源的商业顶级模型在总体上领先,GPT-5.4-mini和Gemini-2.5-flash分列前两名。但这种领先并不是全方位的:Gemini-2.5-flash在认知层最强,医疗模型Hulu-Med-32B在推理层最强,而GPT-5.4-mini只在感知层独占鳌头。没有任何一个模型在三个层次上都称王,这说明当前各类模型都有自己的能力偏向,尚无"全科医生"级别的均衡选手。
六、一道具体的题目:AI为何看不懂脉络膜
研究团队还专门呈现了一个具体的案例来说明上述问题在实际题目中是怎么体现的。题目是:图像中被红色高亮标记的解剖区域是什么?四个选项分别是玻璃体、脉络膜、角膜和视网膜。被标记的区域位于视网膜各层的下方,正确答案是脉络膜。
在这道题上,GPT-5.4-mini和Gemini-2.5-flash给出了正确答案,但Grok-4-fast把它误判为视网膜。六个开源通用模型中,只有InternVL2.5-4B、InternVL2.5-26B和Qwen2.5-VL-32B答对,其余三个分别错选了视网膜、玻璃体和角膜。医疗模型中,大多数答对了,但MedGemma-4B和MediX-R1-8B把它错认为角膜——角膜是眼球最前方的透明组织,而不是眼球后壁,这两者在解剖位置上可谓南辕北辙。
由于被标记区域已经在图上明确高亮,这道题的失败很难归因于"没找到目标",而更可能反映的是AI对视网膜解剖知识的理解本身就不够扎实。而在临床逻辑链上,如果AI连"这里是脉络膜"都判断错了,那么后续基于脉络膜病变所做的所有推理,自然都会出错,错误会像多米诺骨牌一样向下传导。
说到底,OCT-Bench这套测试系统告诉我们一件既重要又值得持续思考的事:当前的AI在眼科OCT图像理解这个任务上,已经具备相当不错的图像识别能力,却在更深层的医学理解和临床决策方面仍然表现出显著的局限性。这不是某一类模型或某一个技术路线的问题,而是一个普遍性的挑战——无论是商业顶级模型、开源大模型还是专门的医疗AI,都没有摆脱这一规律。更大的参数量和更多的医学训练数据能带来一定的进步,但并没有弥合从"看清楚图"到"做出可靠临床判断"之间的根本鸿沟。
这对我们意味着什么?在眼科临床实践中,AI辅助诊断工具目前可能在图像质量评估、基础解剖识别等感知层任务上具有一定可靠性,但在制定治疗方案、判断疾病分期、动态调整随访策略等需要临床推理的任务上,仍不能作为独立决策依据。OCT-Bench的构建,正是为了在这个领域里提供一把公正、细粒度的量尺,帮助研究者更清楚地看到不同AI系统的能力边界在哪里,从而有针对性地改进。
对眼科AI的研究者而言,这项研究给出了明确的努力方向:不是简单地堆砌更多数据或扩大模型规模,而是要在视觉证据的精细理解、图像与医学知识的对齐,以及多步骤临床推理这三个方向上做更深入的工作。而对普通患者而言,这至少告诉我们:在AI真正能独立读懂一张OCT图之前,你在眼科诊室里遇到的那位医生,仍然是不可替代的。
有兴趣深入了解这项研究的读者,可以通过arXiv编号2607.16609检索原论文,代码和测试集也在GitHub上公开,地址在论文中有完整提示。
Q&A
Q1:OCT-Bench测试集是怎么保证题目质量的?
A:OCT-Bench的题目经过两轮质控。第一轮由GPT-4o自动检查题目质量、答案唯一性和图文一致性;第二轮由眼科领域专家人工审核医学正确性、视觉可回答性、任务相关性和歧义性,不合格的题目会被修改或删除。最终保留的10076道题均通过了这套双重审核流程。
Q2:医疗专用AI在OCT理解上表现更好吗?
A:不一定。部分医疗模型如Hulu-Med-32B和Lingshu-32B确实在推理层和认知层有相对优势,但同属医疗模型的HealthGPT-M3和MedGemma-4B总分却低于多个普通通用模型。医疗专业训练可以强化某些特定能力,但并不保证全面均衡地理解OCT图像。
Q3:OCT图像中哪类疾病的AI诊断准确率最低?
A:在疾病诊断任务中,视网膜静脉阻塞(RVO)的平均诊断准确率只有约2.5%,视网膜动脉阻塞(RAO)约5.5%,青光眼约7.8%,这三类疾病的AI诊断结果基本等同于随机猜测,远低于黄斑裂孔(58.4%)和中心性浆液性脉络膜视网膜病变(53%)。
热门跟贴