编辑丨王多鱼

排版丨水成文

诊断一张千兆像素的病理切片,从来不是「看一眼就下结论」。病理医生会先在低倍镜下扫视全局,锁定可疑区域后再逐级放大,反复穿梭于不同倍率与视野之间——这是一个「边看边想」的交互过程。然而,恰恰是专家这套最宝贵的阅片经验,几乎从未进入过人工智能(AI)的训练数据。

2026 年 7 月 24日,宾夕法尼亚大学黄治(Zhi Huang)团队(王晟Ruiming Wu为论文共同第一作者)领衔,联合斯坦福大学、加州大学旧金山分校的研究人员,在Nature Biomedical Engineering期刊发表了题为:Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour 的研究论文。

该研究提出了Pathology-CoT框架,把病理专家阅片时「看哪里、为什么看」的隐性经验,转化为可规模化的 AI 训练数据,并据此开发出病理 AI 智能体——Pathology-o3——它能像专家一样自主导航全切片、给出可解释的诊断,在胃肠道淋巴结转移检测任务上以84.5% 的精确率、100% 的召回率,显著超越 OpenAI 的推理模型 GPT-o3,其阅片路径也与资深主治病理医生高度一致。

打开网易新闻 查看精彩图片

病理 AI 的瓶颈:不在模型,而在数据

过去两年,病理基础模型与视觉语言模型(VLM)的进展,让AI病理智能体成为可能。所谓智能体(Agent),是指能够感知环境、借助大语言模型进行推理与任务编排,并通过缩放、平移、选取区域等一系列动作,去完成复杂诊断目标的系统。

黄治团队指出,当前真正的瓶颈已经从模型架构转移到了数据。与编程或数学不同,临床诊断无法靠简单的规则化奖励来引导——智能体必须学会病理医生「如何查看切片」以及「针对每个任务应该关注哪些区域」。而现有数据集要么是从互联网爬取的图文对,要么是全切片与报告的配对,都缺失了最关键的一环:专家的阅片行为

现代数字病理系统其实一直在默默记录这些行为,问题在于,这些「数字尾气」(digital exhaust)高频、嘈杂且极其冗长:主动浏览的采样率约为10 Hz,平均每张切片会产生257以上的视野变更事件。如果把原始视野直接喂给视觉语言模型,单个病例将产生超过50个视觉 token,远超当前模型的上下文上限,根本无法有效学习。

打开网易新闻 查看精彩图片

AI 阅片记录仪将连续、嘈杂的用户日志(a),转化为离散、有意义的行为指令,并经人在回路核验生成 Pathology-CoT 数据集(b);10.6 小时的结直肠癌淋巴结队列包含 5222 轮对话(c),标注效率较手工提升约六倍(d)

AI 阅片记录仪:把鼠标轨迹变成 AI 训练数据

研究团队开发了一款病理AI 阅片记录仪(AI Session Recorder),它可以在标准全切片阅片软件中无感知地运行。受物理显微镜物镜切换的启发,它把混乱的操作流离散化为紧凑的行为指令:低倍率下的广域巡视(inspect)或高倍率下的快速细看(peek),并各自绑定一个标准化的关注区域(ROI)。同时,系统用这些区域去提示视觉语言模型,由 AI 起草「为什么看这里、能看到什么」的推理,再交由病理医生快速核验或修改。

这套「人在回路」的设计带来了效率的量变。计时研究显示:核验者确认一轮 AI 草稿平均只需十几秒,即使需要修改也远快于从零标注。综合下来,该流程比手工打字标注快约5-6 倍、比口述快约 3-4 倍,且约80%的 AI 生成文本无需任何修改。为验证记录仪捕捉到的确实是「专家的注意力」,研究团队还同步接入眼动追踪设备,结果证实记录仪生成的 ROI 与病理医生的真实视线高度吻合。

最终形成的Pathology-CoT数据集,来自斯坦福医学 8 位病理医生(涵盖主治、专科培训医师与住院医师)在 25 个病例、137 张切片上共 10.6 小时的阅片记录,包含 921 个会话、5222 轮对话——它不仅记录了专家「看哪里」,更捕捉了「为什么这里重要」。

Pathology-o3:先决定「看哪里」,再回答「看到了什么」

有了这批数据,研究团队构建了模仿病理医生工作流的智能体——Pathology-o3。它分两步走:先由一个行为预测器在新切片上提出诊断相关的区域,再对每个区域自动裁切出高分辨率视野、注入任务上下文,交由视觉语言模型逐区推理,最后综合成病例级结论。整个过程会输出一条可读、可核查的「视觉思维链」。

打开网易新闻 查看精彩图片

Pathology-o3 的工作流程(a)、一个真实的「思维链」示例(b),以及在淋巴结转移任务上的定量比较(c)——它在保持完美召回的同时取得最佳总体准确率

胃肠道淋巴结转移检测这一常见且耗时的任务上,Pathology-o3 达到了84.5% 精确率、100% 召回率、75.4% 准确率。作为对比,表现次优的 OpenAI GPT-o3 分别为 46.7%、87.5%、57.8%。不具备思维链能力的模型则普遍失衡:GPT-4.1 召回率高达 91.7%、精确率却只有 42.3%;Llama-4 精确率 75.0%、召回率仅 6.2%。

更值得注意的是最难的「边缘病例」——直径不足 0.2 毫米的孤立肿瘤细胞:常规模型纷纷失手,而 Pathology-o3 依靠主动放大保持了稳健的敏感性。跨模型的对照进一步说明了行为数据本身的价值:只需在有限数据上训练一个轻量的行为预测器,就能把专家的阅片策略「蒸馏」成可无限复用的资产,而不必持续投入大规模的专家标注。

它是真的在「像人一样阅片」

为了检验智能体学到的究竟是不是导航能力,研究团队把行为预测器撤掉,让各家视觉语言模型自己决定看哪里,再与一位有 12 年经验的资深胃肠道主治病理医生的真实阅片路径对比。结果,未经行为引导的通用模型选区零散、低产,而 Pathology-o3 的注意力则牢牢落在临床上真正有意义的位置,与主治医师的实际行为高度重叠。

打开网易新闻 查看精彩图片

六个病例上各模型选取的关注区域(红框)。通用视觉语言模型选区零散,而 Pathology-o3 集中在与主治医师真实行为高度重叠的关键位点

这揭示出一道被长期忽视的鸿沟:视觉语言模型强大的分析能力,来自海量静态、预先裁切好的图像;而它们导航失败的根源,正是缺少「与复杂环境持续视觉交互」的数据。分析与导航,是两种不同的能力。

换了扫描仪、国家和器官,依然有效

在完全独立的外部验证队列 LNCO2 上(来自瑞典的 321 张切片,使用不同扫描仪与倍率,与训练数据存在明显差异),基于美国病理医生行为训练的 Pathology-o3 仍取得了97.6% 的近乎完美召回率,精确率是次优模型的两倍以上。这说明,在「如何看、看哪里」层面上的监督,比像素级监督更能抵抗图像外观的变化。

研究团队进一步把框架迁移到组织结构完全不同的皮肤病理。重新训练后的 Pathology-o3 在外部皮肤病理队列上肿瘤检出召回率达 100%;尤为亮眼的是,在最具挑战的黑色素细胞肿瘤上,零样本的 Pathology-o3 取得88.9% 的召回率,甚至超过了在全量数据上完全监督训练的最佳模型。

打开网易新闻 查看精彩图片

在外部皮肤病理队列上,Pathology-o3 学会主动放大到真皮—表皮交界处、异型细胞巢等解剖学标志,从而分辨出低倍率下不可见的细微形态特征

总的来说,这项研究把「AI如何学会像病理专家一样看片」这一核心难题向前推进了一步。它给出的答案不是更大的模型,而是一台更好的数据引擎:把每天都在临床工作中自然产生、却被白白丢弃的阅片行为,转化为可规模化、临床可信的监督信号,为构建行为对齐、临床可信的数字病理智能体提供了新范式。

打开网易新闻 查看精彩图片

黄治博士

论文通讯作者黄治博士现任宾夕法尼亚大学佩雷尔曼医学院终身教轨助理教授(Tenure-track Assistant Professor)。2026 年获评宾夕法尼亚大学 Abramson Cancer Center 与 Breakthrough Challenge Foundation 联合设立的 Buz Cooper Scholar。黄治实验室致力于开发新一代医疗人工智能基础模型与智能体(Agentic AI)系统,重点研究多模态视觉语言大模型、多组学人工智能及医学影像智能分析,服务于医疗诊断、精准医疗与临床决策。作为第一作者,他发表了病理视觉语言基础模型(Nature Medicine 2023,封面论文)、医疗诊断人机协作框架(Nature Biomedical Engineering 2024,封面论文)、神经退行性疾病 AI 研究(Nature Communications 2023)等系列代表性成果,相关研究发表于 Nature、Nature Biomedical Engineering、Nature Medicine、Cancer Cell、等国际知名期刊。

2022 年,黄治联合创立数字病理人机交互 AI 平台——nuclei.io,入选 2023 年 Stanford Catalyst 全校仅九项重点创新项目之一。实验室自成立以来,已以第一或通讯作者身份在 Nature、Nature Biomedical Engineering、Cancer Cell 等国际顶级期刊发表多项研究成果与评论文章,持续推动 AI 在医学诊断领域的基础研究与临床转化。

宾夕法尼亚大学黄治实验室拥有丰富的医疗数据资源与高性能计算平台。宾夕法尼亚大学病理学系是佩雷尔曼医学院两大以医院为基础的临床学系之一,每年完成约 1000 万例病理及相关医学诊断;实验室配备多台 NVIDIA H200 GPU 服务器,为大规模人工智能模型训练与医学多模态数据分析提供强大的计算支持。实验室长期欢迎海内外优秀人才申请博士与博士后岗位。

论文链接:

https://www.nature.com/articles/s41551-026-01739-y

代码与数据:

https://github.com/zhihuanglab/Pathology-CoT

实验室主页:

https://www.zhihuang.ai/

宾大病理系:

https://pathology.med.upenn.edu/