撰文丨王聪
编辑丨王多鱼
排版丨水成文
多模态眼科诊断需要整合眼底摄影、B 超和医学证据,但大多数人工智能(AI)系统仍停留在单任务或弱依据层面。
2026 年 8 月 18 日,浙江大学医学院附属第二医院金凯团队在 Cell 子刊Cell Reports Medicine上发表了题为:An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis 的研究论文。
该研究开发并系统性评估了自主多模态眼科 AI 智能体——AgentEYE,其整合了专业眼科影像工具、医学证据检索和大语言模型综合推理,将眼科 AI 从单一影像分类推进到可追溯、可审计的多模态诊断支持。
人工智能(AI)在眼科领域取得了突破性进展,深度学习模型在糖尿病视网膜病变筛查、基于光学相干断层扫描(OCT)的视网膜层分割以及青光眼视神经病变自动检测等任务中已达到专家水平甚至更优表现。然而,这些系统目前仍主要局限于单模态、特定任务的应用——即针对单一图像类型或预定义病灶进行识别的孤立分类器。它们往往无法体现眼科医生的综合判断能力,而眼科医生通常会整合多种影像学检查(例如眼底照相、B 超和 OCT)、临床病史以及指南指导下的鉴别诊断,以应对诊断不确定性并制定循证治疗方案。
大语言模型(LLM)的出现推动了人工智能向具备多模态推理和医学知识整合能力的通用型 AI 范式转变。诸如 GPT-4 等模型已在解读复杂临床病例方面展现出接近人类水平的能力,并在如美国医师执照考试等标准化考试中取得及格成绩。配备视觉-语言能力的 LLM 已开始连接文本与影像,能够基于眼底图像生成初步报告,或根据病史对紧急转诊进行初步分诊。然而,尽管取得了这些进展,通用型多模态 LLM 在临床眼科领域仍存在局限性:细微的形态学特征(例如早期视网膜前膜或浅层脱离)以及跨模态关联对诊断和治疗决策至关重要。目前相关研究中的 LLM 仍仅作为被动预测工具,而非主动的诊断助手,无法协调不同成像模态、执行迭代验证,也无法整合结构化的眼科知识以支持安全的临床决策。
近期应对这些挑战的努力已开始采用眼科专用的微调方法,或从教科书和临床指南中进行检索增强生成(RAG),从而提升了事实记忆能力和领域一致性。然而,这些方法在很大程度上仍处于静态状态,缺乏自主或自适应推理能力。
在这项最新研究中,研究团队开发并评估了AgentEYE——这是一种专为基于循证医学的眼科诊断与决策支持设计的自主多模态临床 AI 智能体。它将基于大语言模型(LLM)的推理核心与眼科领域特定的影像工具、指南驱动的检索系统以及网络证据搜索功能相结合,用于处理眼底图像和 B 超图像,并生成基于证据的综合报告。
在包含 302 例病例的内部基准测试中,AgentEYE在诊断正确性和完整性方面优于仅使用大语言模型(LLM)的基线模型,以及未配备专用成像工具的消融版本;其性能与不进行检索的消融版本相似,表明检索主要支持证据依据和引用可审计性。三位眼科医生对 200 例病例的盲法评估证实,相较于仅使用 LLM 的自我引用基线,AgentEYE 在诊断正确性、完整性、安全性以及引用依据方面均有所提升。外部分析显示,AgentEYE 的性能具有分布依赖性。
总的来说,这些发现支持 AgentEYE 作为可追溯的决策支持原型,但在临床工作流程部署前,仍需开展前瞻性多中心验证。
论文链接:
https://www.cell.com/cell-reports-medicine/fulltext/S2666-3791(26)00386-1
热门跟贴