《自然·医学》2026 年 9 月 22 日上线了一篇中国团队主导的研究,题目直译是「用平扫 CT 加人工智能做大规模食管癌筛查」。他们训练出的模型叫 EAGLE,输入是一次普通的胸部平扫 CT:没打对比剂、没做胃镜、也不是为食管专门安排的检查。在 8 家医院、11466 人的外部验证里,这个模型查出了 90.0% 的食管癌,特异度 98.5%;但对癌前病变(高级别上皮内新生物,缩写 HGIN)只查出 52.5%。研究在中国临床试验注册中心登记(ChiCTR2300074806)。
一个结果和一个限制摆在一起,正好问出了读者会卡住的地方:食管癌一向靠胃镜查,一张查肺的平扫 CT 上凭什么能看出来?既然癌能查出九成,为什么癌前病变还会漏掉一半?
食管癌为什么一直靠胃镜
2022 年全球食管癌新发约 51.1 万例、死亡约 44.5 万例。它的麻烦在于确诊太晚:中国食管癌的 5 年生存率是 36.9%,美国是 18.5%,都不好看。
中国在高发地区做了多年的内镜筛查,证据是硬的,ESECC 随机试验的 9 年报告显示,一次性内镜筛查能降低食管癌的发病和死亡。问题在覆盖面。内镜是侵入性检查,要预约、要麻醉或咽部麻醉、要有内镜医生和消毒周转的床位。即便在高危人群里组织筛查,一次内镜筛出恶性病变的比例也只有 0.80% 左右,意味着每查一百多个人才碰上一个。愿意来的人又不多,很多该查的人根本不进这个门。
所以研究者的思路是去找一个已经存在的入口。胸部 CT 占了全部 CT 检查的四成左右,不管是住院前的常规检查、急诊的胸痛排查,还是肺癌低剂量 CT 筛查,扫描范围本来就把整条食管包在里面。吸烟同时是肺癌和食管鳞癌的危险因素,两类人高度重叠。片子已经拍了,信息已经在硬盘里,只是没人去读食管。
这段食管在平扫 CT 上为什么难读
食管是一根空腔管道,平时是瘪的,前后壁贴在一起,粗细随吞咽和呼吸变化。它紧挨着心脏和主动脉,每一次心跳都会把图像带出运动伪影。横断面上切出来,常常只是纵隔里一个形状不规则的小软组织影。
早期病变的尺度又很小。HGIN 还局限在上皮层,I 期食管癌也只侵到黏膜或黏膜下,厚度以毫米计。这个量级的增厚,和生理性狭窄、塌陷造成的管壁堆叠在密度和形态上几乎分不开。平扫没有对比剂,病灶和正常管壁的密度差本来就小。
结果就是放射科医生在常规阅片里不会去找它,也很难找到。研究者引用的一项分析发现,后来死于食管癌的人,大多数在此前 5 年的胸部 CT 报告里没有留下任何食管可疑记录。
这篇研究自己的阅片实验给出了同一个问题的量化版本。300 例片子(200 例恶性、100 例阴性)交给 17 名放射科医生,其中 3 名食管专科、6 名普通放射科医生、8 名住院医师,平均从业 7.6 年。不借助 AI 时,他们对食管恶性病变的平均敏感度是 71.9%,特异度 79.6%。细分到早期:HGIN 的平均敏感度 36.3%,I 期癌 59.8%。
关键一步在标注,不在模型
模型要学会识别一个人眼都标不出来的东西,训练标签从哪来?这是整篇研究里最值得讲的一步。
团队没有让标注者「在平扫 CT 上找病灶」。他们换了一条路:内镜手术切下来的标本有病理报告,报告里写着病变距门齿多少厘米,这是厘米级的纵向定位;再把这个位置拿到同一个病人的增强 CT 上,由食管专科放射科医生去对照着找对应层面的异常;两名标注者各做一遍,分歧交专家裁定,最后落成体素级的食管轮廓和病灶掩膜。
换句话说,标签的来源是病理和内镜,不是 CT 上的可见度。于是那些「人眼看不出来、但病理证实确实在那里」的病灶,也带着准确坐标进了训练集。训练集一共 6813 例,来自中山大学肿瘤防治中心和四川省肿瘤医院,其中 264 例 HGIN、548 例 I 期、2932 例 II–IV 期、3069 例阴性对照。阴性对照要有至少 2 年随访或 1 年内的阴性内镜才算数。
模型本身分两步:先在整个三维 CT 里把食管定位出来,再在这一段里同时做病灶分割和患者级的恶性概率预测,输出一张热图标出哪些区域支撑了判断。阈值可以调:用在医院里顺带筛查时,把阈值调到 99% 特异度那一档;用在高危人群内镜筛查前分流时,调到 98% 敏感度那一档。同一个模型,两种用法。
下图来自原文 Fig. 2h,是一例胸段食管下段的癌前病变:左边是原始平扫 CT,中间是模型勾出的病灶轮廓,右边两张是热图,颜色最亮的地方就是支撑它判断的区域。三张对照着读,能体会到这个病灶在原始图像上有多不起眼。
外部验证的数字,以及它在哪里变弱
内部 2500 例:曲线下面积 0.991,敏感度 89.4%,特异度 99.3%。
外部 8 家中心、11466 例,横跨中国、捷克和澳大利亚:曲线下面积 0.976,总敏感度 89.5%,特异度 98.5%。捷克队列敏感度 94.4%,澳大利亚队列 90.2%,跨人群没有塌掉。
按病变分层看,差距才出来。癌是 90.0%,HGIN 只有 52.5%。按分期看,I 期 60.1%、II 期 93.1%、III 期 95.9%、IV 期 96.2%,敏感度随分期一路爬升。按位置看,中段 92.2%、下段 91.8%、上段 84.4%,而食管胃结合部只有 76.4%:这个部位本来就和胃底、膈肌脚挤在一起,形态判断最不稳。按性别看,男性 90.7%、女性 84.3%,作者把它归因于训练数据里男性病例远多于女性。
同一批片子交给 17 名医生,加上 AI 的分割图和概率提示再读一遍(两轮间隔至少 3 个月以冲掉记忆),敏感度从 71.9% 升到 85.7%,特异度从 79.6% 升到 91.7%,两项都是 P<0.001。对早期病变帮助更明显:HGIN 平均敏感度抬高 16.6 个百分点,I 期抬高 22.7 个百分点,住院医师加上 AI 之后接近食管专科医生的水平。
人机合作并没有达到 AI 单独的高度。EAGLE 单独的曲线下面积是 0.981,比医生平均高出 19.1 个百分点的敏感度和 18.4 个百分点的特异度;医生看过 AI 提示之后,成绩抬上去了,仍停在 85.7% / 91.7%。作者给的解释很实在:在平扫 CT 上评估早期食管癌并不属于目前的常规工作,医生没有受过针对性训练,面对一个非常规指征的 AI 提示,他们会打折扣地采纳。把 AI 做出来和把 AI 装进流程,难度并不一样。
为什么阳性预测值会从 55% 掉到 12.5%
在三家大型中心、35402 人次的真实世界数据里,模型第一次遇到没挑选过的病人:门诊、急诊、住院、体检混在一起。第一批 20758 人中有 285 例食管恶性,敏感度仍有 89.6%,但特异度从 98.5% 掉到了 95.5%。掉的这三个百分点换算成人头,就是四百多个假阳性。
研究者把这批难例(所有假阳性、所有假阴性,再加上刚过阈值的边缘真阳性)挑出来重新标注、并进原训练集微调,得到升级版 EAGLE-Plus。在第二批 14644 人上,假阳性从 432 个降到 118 个,少了 72.7%;阳性预测值从 25.3% 升到 55.0%;敏感度 89.8% 对 88.3%,没有显著差别(P=0.62)。
接着是两个真刀真枪的场景,数字差得很远:
医院前瞻验证,17446 人,2025 年 1 月到 4 月入组、随访到 2026 年 7 月。模型报阳 90 人(阳性率约 0.5%),其中 38 人确认是真的(36 例癌、2 例 HGIN),阳性预测值 42.2%。
体检低剂量 CT,10959 人,45 到 75 岁。模型只报阳 8 人(阳性率 0.07%),特异度 99.94%,而阳性预测值 12.5%。
同一个模型、同一套阈值,一个阳性结果的分量为什么差三倍多?因为阳性预测值由人群的患病率决定。医院里做胸部 CT 的人,本来就有相当一部分带着症状或已知肿瘤,食管恶性的比例高;体检中心里 10959 个无症状的人,真有食管恶性的大概只有个位数。特异度 99.94% 听着极高,可它作用在一万多个健康人身上,仍会生出几个假阳性,而真病人一只手数得过来。两边一除,阳性预测值就塌下来了。
同样的算术也解释了为什么作者要费力气做那一轮降假阳性的微调。筛查工具的瓶颈往往不在敏感度,而在每多报一个阳性就多一个人要去做胃镜、多一家人要担心一个月。
把内镜留给更可能有病的人
另一条用法反过来:不替代内镜,而是决定谁先去做内镜。
在四川遂宁和浙江丽水两家筛查中心,研究者收集了 702 例既做过内镜又做过平扫 CT 的配对数据,把阈值调到高敏感度那一档。总敏感度 90.2%,特异度 84.7%;癌 92.2%,HGIN 65.0%,I 期癌 78.4%。漏掉的 I 期病例里,超过九成属于巴黎分型 0-II 型,也就是表浅平坦型,这类病变在内镜下也最难发现。
前瞻的分流验证做在遂宁:2023 年 7 月,530 名符合国家上消化道癌筛查条件的居民先做平扫 CT,再做碘染色内镜。这批人里查出 6 例 HGIN,没有浸润癌。恶性事件太少,作者改用重采样补进 3 例癌,拼成一个 533 人、9 例恶性的模拟队列,做了 1000 次自助法模拟。
结果是:按老办法 533 人全做内镜,检出率 1.7%;按 AI 分流,只有约 131 人去做内镜,查出 6.8 例,检出率升到 5.2%(P<0.01)。每查出一例恶性需要筛查的人数从 59.2 降到 19.2,省掉 67.6% 的内镜,折算成内镜室的时间是从 355 小时降到 105 小时。
两个细节让这套分流显得没那么冒险。第一,被判为阴性的 402 人里,400 人内镜下确实没有恶性,剩下 2 例是 HGIN,阴性预测值 99.46%。第二,被判阳性却没查出恶性的 124 人中,有 59 人(47.6%)查出了需要专门随访的食管异常,包括 14 例低级别上皮内新生物。假阳性里有接近一半的人,这趟内镜其实没白做。
此外,研究者还回头翻了 28 例食管癌病人确诊之前拍的 CT,模型在其中 18 例(64.3%)上就已经判为阳性,有 4 例的片子拍在确诊前 9 个月以上。真实世界队列里也有一例,模型判阳 21 个月后才由常规内镜确诊。
这篇研究不能推出什么
最要紧的一条:全文没有任何死亡率或生存率终点。它证明的是「这些病灶在平扫 CT 上能被算法认出来」,不是「这样筛查能让人少死」。从检出率到死亡率,中间隔着依从性、过度诊断、治疗可及性,隔着多年随访。
作者自己列的限制也值得照抄:境外验证只有捷克和澳大利亚两国,腺癌和食管胃结合部病例偏少,补充训练后腺癌敏感度从 86.6% 升到 91.2%,说明现有版本对西方更常见的腺癌还不够熟;女性数据偏少;分流用途的证据来自回顾性配对队列加单中心的模拟,阳性事件数很小;两个真实世界队列随访不到 2 年,而且 MDT 建议去做内镜的人实际完成率很低(前瞻验证里转诊的 16 人只有 3 人真去做了胃镜),所以模型的真实敏感度未必被完全测出来;阅片实验没有完整的交叉设计,回忆偏倚不能完全排除。
还有一条落在纸面之外:模型代码受专利保护、训练数据不公开,目前是一项研究成果,不是你能在体检套餐里勾选的项目。
对一个普通人意味着什么
如果你属于食管癌高危人群(高发地区居住、长期吸烟饮酒、有家族史、长期吃烫食或腌制食品、有反流病史),目前国内的标准做法仍是去做内镜筛查,碘染色内镜看黏膜颜色和血管纹理,发现可疑处当场取活检。这项研究没有给出任何理由让人用 CT 替掉胃镜。癌前病变在平扫 CT 上漏掉一半,而内镜下这类病变恰恰能切掉、能阻断。
研究真正改变的是另一头:如果你本来就要做胸部 CT 或肺癌低剂量 CT,这张片子里关于食管的信息比现在被用掉的多。等这类模型进入临床流程,一次扫描可以同时覆盖肺和食管,不额外加辐射、不额外加费用,一举两得。研究者也提到,HGIN 进展到 I 期癌的年概率是 8% 到 18%,窗口期以年计,一次漏掉不等于永远漏掉,每年一次的重复筛查可以把累计检出率抬起来。结直肠癌的粪便免疫化学试验走的就是这条路:单次敏感度并不出众,靠频次和覆盖面在人群层面降低了死亡。
说到底,这项工作更像是把一个已经被采集、却一直被浪费的信号重新读了一遍。食管的影像一直躺在那些胸片的数据里,只是过去没有人、也没有工具去读它。
参考来源
Zhou J, et al. Nat Med 2026 (EAGLE, ChiCTR2300074806)
Bray F, et al. CA Cancer J Clin 2024 (GLOBOCAN 2022)
Liu M, et al. J Clin Oncol 2024 (ESECC trial, 9-year report)
Cao K, et al. Nat Med 2023 (pancreatic cancer detection on noncontrast CT)
National Health Commission of China, Chin J Cancer Res 2022 (esophageal carcinoma guidelines)
AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。
热门跟贴