《自然·医学》2026 年 9 月 22 日在线发表了一项中国牵头的研究。中山大学肿瘤防治中心、四川省肿瘤医院等单位联合阿里巴巴达摩院,做了一个叫 EAGLE 的影像模型,用的是最普通的胸部平扫 CT,也就是不打造影剂、体检和急诊天天在拍的那种。在 8 家医院 11466 人的外部验证里,把特异度卡在 98.5% 时,它对食管癌的灵敏度是 90.0%。研究注册号 ChiCTR2300074806。
放射科的常识一直是:平扫 CT 上看不出早期食管癌。论文作者在摘要里用的词是"历史上被认为不可能"。
同一张 CT,图像里的像素一个没多,人看不出来,机器凭什么看得出来?
食管在 CT 上为什么这么难看清
食管是一根从颈部穿过胸腔、走到膈肌下面的空管子,管壁薄,平时是塌着的,没有气体或造影剂把它撑开。它前面贴着气管和心脏,旁边是主动脉,心脏每跳一下、呼吸每动一次,这一段图像就带上搏动伪影。
病变本身也小。早期食管癌有两种情况:一种是高级别上皮内瘤变,癌细胞还没穿透基底膜,只在上皮那一层里;另一种是 I 期癌,刚侵到黏膜或黏膜下层。这两种病灶的厚度是以毫米计的,它们造成的管壁增厚,可能比食管自己的生理性狭窄还轻。
一个会塌、会动、壁本来就薄的管子,上面有一处几毫米的增厚。医生要在几百层横断面图像里逐层找它,还要和正常的生理性缩窄区分开。原文引用了一项研究:那些最终死于食管癌的人,往期五年里的胸部平扫 CT 报告中,大多数没有记录任何可疑的食管所见。
问题不在医生认不认真,而在这项任务本身的信噪比太低。
让模型学会的,是一套重新来过的标注
这项研究里最关键的一步,不在网络结构上。EAGLE 的骨架是公开的 nnU-Net,两个阶段:第一阶段先把食管这一根管子从整个胸腔 CT 里分割出来,去掉肺、心脏、椎体这些不相干的结构;第二阶段只在这一小段感兴趣区里干活,同时输出三样东西:病灶的分割掩膜、这个人是恶性的概率,以及一张热图,标出模型是根据哪块区域做的判断。这套做法在影像 AI 里不算新。
真正解决问题的是标注。
要训练模型认出早期食管癌,得先有人在 CT 上把病灶一个体素一个体素地圈出来。可问题恰恰是:这些病灶在平扫 CT 上看不清。如果标注员也只能"凭看得见"来圈,那圈出来的只会是那些本来就明显的中晚期病灶,模型学到的也只是这些,早期的永远学不会。这是一个死循环。
作者绕开了"看得见"这个前提,用事后才知道的答案回头去标当时看不清的图:
① 内镜下切除后的病理报告,能给出病灶在食管里的位置,精确到厘米;
② 食管专科的放射科医生在同一个病人的增强 CT 上,能找到平扫上看不清的那处异常;
③ 两条信息交叉对照,再走两名标注员标注、专家仲裁的标准化流程,最后把病灶画在平扫 CT 上。
这样训练集里才凑出了 264 例高级别上皮内瘤变和 548 例 I 期癌,每一例都带着体素级的掩膜。模型学的是这些人眼判断不稳定、但在像素层面确实存在的细微征象。在内部 515 例有标注的测试里,模型画出的病灶与人工标注的重合度(Dice 系数)是 0.744。
所以"AI 比医生眼睛好"这个说法并不贴切。更接近事实的是:有人把病理和增强 CT 的答案抄到了平扫 CT 上,模型从答案里学会了找题。作者在讨论里也点了这一层,认为这套标注思路可以移植到其他"过去被认为平扫 CT 做不了"的癌种上。
和医生比,差了多少
研究做了一个阅片者研究:300 例胸部平扫 CT(200 例阳性、100 例阴性)来自 4 家医院,请 17 位放射科医生读两轮,两轮之间隔至少 3 个月,避免记住上一轮的答案。
第一轮医生单独读。整体灵敏度 71.9%,特异度 79.6%。单看早期病变,17 位医生对高级别上皮内瘤变的平均灵敏度只有 36.3%,对 I 期癌是 59.8%。
EAGLE 单独读,灵敏度比医生均值高 19.1 个百分点,特异度高 18.4 个百分点,都有统计学差异。对高级别上皮内瘤变 65.7%,对 I 期癌 87.1%。
第二轮,医生看着 EAGLE 给出的病灶分割和恶性概率再读一次同样的片子。灵敏度从 71.9% 升到 85.7%,特异度从 79.6% 升到 91.7%。对高级别上皮内瘤变的灵敏度平均提高 16.6 个百分点,对 I 期癌提高 22.7 个百分点。原文还提到,住院医师在 AI 辅助下的表现接近食管专科医生。
有个细节作者写得很老实:医生加 AI 的成绩,低于 AI 单独的成绩。也就是说模型的能力没有完整传递给人。他们给的解释是,在平扫 CT 上评估早期食管癌本来就不是现行的临床常规,放射科医生没有受过这项任务的专门训练,面对一个非常规提示,接受还是否决它,判断本身就不稳。
同一个模型,在不同人群里意义完全不同
灵敏度 90%、特异度 98.5% 听起来很硬。但一个被 AI 标为阳性的人,想知道的是另一个数:报告说我可疑,我得癌的可能有多大。这个数叫阳性预测值,它不由模型单独决定,还取决于这群人里本来有多少病人。
研究里这个数在不同场景下跳得很厉害。
在 3 家大型医院的真实世界队列里,模型第一次上线时特异度掉到了 95.5%,原因是门诊、住院、急诊的病人构成远比研究用的精选队列复杂。作者拿这批难例做了一轮校准,得到 EAGLE-Plus,在后一批 14644 人里把假阳性从 432 例降到 118 例,降幅 72.7%,灵敏度基本不变(89.8% 对 88.3%,P=0.62),阳性预测值从 25.3% 提到 55.0%。
在医院里做的前瞻验证,2025 年 1 月到 4 月连续跑了 17446 个人。模型报了 90 例阳性,阳性率约 0.5%,其中 38 例证实是食管癌或癌前病变,阳性预测值 42.2%。
在体检的低剂量 CT 人群里,10959 名 45 到 75 岁的参加者,模型只报了 8 例阳性,阳性率 0.07%,最后确认 1 例,阳性预测值 12.5%。
同一个模型,同一套阈值,阳性预测值从 55% 一路掉到 12.5%。原因只有一个:人群不同,病的比例不同。医院里来做检查的人本来就有症状、有转诊理由,体检中心的人基本没症状。所以在体检报告上看到"AI 提示食管可疑",它的含义更接近"这里有个需要排掉的东西",而不是"你多半得了食管癌"。反过来,在医院里同样一句提示,分量要重得多。
所以拿到 AI 提示的人,先要弄清自己属于哪一类人群,而不是直接按最坏的可能去想。
它不能替代胃镜
有三个理由。
一是物理上的限制。癌前病变只累及上皮层,食管壁的厚度几乎没有变化,CT 上能携带的信息本来就少。所以在 98.5% 特异度这个工作点上,模型对高级别上皮内瘤变的灵敏度只有 52.5%,将近一半会漏掉。研究也试过把阈值放宽,特异度降到 91.0% 时,I 期癌的灵敏度能升到 73.4%,代价是假阳性成倍增加。筛查里这两头永远是跷跷板。
二是确诊这一步绕不开内镜。CT 只能提示"这里可疑",取活检、看病理、决定内镜下切除还是手术,这些都得靠内镜。模型输出的是一个待核实的线索。
三是作者自己给的定位就不在这里。他们把 EAGLE 放在四个场景里用:给已经拍过的 CT 做机会性复核;把现有的肺癌低剂量 CT 筛查项目顺带扩展到食管;辅助放射科医生阅片;给内镜筛查做分诊。最后这一项做了一次探索性分析,值得照实说清它的性质。研究者在四川遂宁的一家医院,请 530 名准备做内镜筛查的人先拍一次平扫 CT。这批人里只查出 6 例癌前病变,没有浸润癌。为了把患病结构调到接近真实的高危人群,作者又从该中心的测试队列里重采样补进 3 例食管癌,凑成一个 533 人的合成队列,然后做模拟:按老办法 533 人全做内镜,检出率是 1.7%;只让 EAGLE 判为高危的约 131 人去做内镜,检出率升到 5.2%,同时省下约 67.6% 的内镜检查。
要注意,这是在合成队列上的模拟结果,不是两组人分别真的做了内镜,作者在局限里也承认了这一点。但它给出的方向是清楚的:内镜资源有限时,先用 CT 筛一遍再决定谁去做内镜,每找到一个病人需要检查的人数会明显下降。
对中国来说,这个定位是切题的。2022 年全球食管癌新发约 51.1 万例、死亡约 44.5 万例,中国患者的 5 年总生存率约 36.9%,美国是 18.5%。国内的内镜筛查确实有效,但它有创、依从性低、内镜资源有限,很难铺到所有无症状人群。而胸部平扫 CT 是医院和体检中心每天都在做的检查。
这项研究还没有证明什么
论文的局限写得比较完整,这里照实转述。
人群多样性不够。数据以中国为主,境外只有捷克和澳大利亚两国的初步验证。中国的食管癌以鳞癌为主,欧美以腺癌和食管胃结合部癌为主,后者的验证明显不足。作者做的预试验显示,把这类病例加进训练集后,腺癌灵敏度从 86.6% 升到 91.2%。另外女性样本偏少,两性之间的灵敏度存在差异。
作为内镜前分诊工具的证据还不够硬。目前靠的是回顾性的 CT 与内镜配对队列,加上一个中心的前瞻模拟,阳性例数很少。
随访时间不足两年,而且依从性是个现实问题。在那 17446 人的前瞻验证里,多学科团队建议去做内镜的有 16 人,最后真去做的只有 3 人。在体检的低剂量 CT 队列里,也有 5 人没有按建议去做内镜。查出来没人去核实,模型的真实灵敏度就统计不准,这个漏洞在论文里被明确承认了。
阅片者研究没有做完整的交叉设计,虽然两轮之间隔了 3 个月并打乱了顺序,回忆偏倚不能完全排除。
还有一点需要读者自己掂量:这项研究的主要作者中包含阿里巴巴达摩院和湖畔实验室的人员,标注平台和阅片系统也是该团队的产品。这不否定结果,但它意味着独立第三方的外部验证仍然必要。
对普通人来说,眼下能用到什么
如果你已经因为别的原因拍过胸部平扫 CT,尤其是在做肺癌低剂量 CT 筛查,那么这项研究提示了一种可能:同一份影像里也许还藏着食管的信息。研究中有两个例子值得记住,一例是模型在真实世界里揪出的病灶,比临床确诊早了 21 个月;另一例是在体检 CT 里被标为阳性、初次报告没有提及,8 天后确诊为食管癌。
不过这套模型目前还在研究和验证阶段,不是各家医院都能用的常规项目,也没有进入国内的筛查指南。它现在能做的是给影像科医生和筛查项目当辅助。
真正落到个人身上的判断没有变:属于食管癌高危的人,比如长期吸烟饮酒、有食管癌家族史、来自高发地区、有吞咽不适或进食哽噎感的,仍然应该按医生建议做胃镜,胃镜是目前能同时看清黏膜、取到活检和做早期切除的手段。如果体检报告里出现了 AI 相关的可疑提示,合理的做法是带着片子找消化内科或胸外科门诊评估,由医生决定要不要做内镜,而不是自己在网上对号入座。
回到开头那个问题。AI 之所以能在平扫 CT 上找到几乎看不见的早期食管癌,不是因为它有超出物理极限的视力,而是因为有人把病理和增强 CT 的答案搬到了平扫 CT 上,让它学到了人眼不稳定的那部分信息。这条路走得通,也就意味着其他"平扫 CT 做不了"的判断,未必都是定论。
参考来源
· Zhou J, et al. Nat Med 2026 (EAGLE, esophageal cancer screening on noncontrast CT)
· Bray F, et al. CA Cancer J Clin 2024 (GLOBOCAN 2022)
· Yang H, et al. Lancet 2024 (Oesophageal cancer)
· Wei WQ, et al. J Clin Oncol 2015 (endoscopic screening in China)
AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。
热门跟贴