*仅供医学专业人士阅读参考
仅凭一次腹部CT,即可识别146种病症,由中国科学家团队研发的通用影像AI模型RADAR登顶《科学》,标志着医疗影像AI从“一病一模”迈向“一个模型看所有病”。
撰文 |凌骏
来自中国的医疗影像AI,迎来了自己的里程碑时刻。
当地时间9月17日,顶刊《科学》(Science)发表重磅研究成果,阿里达摩院团队联合浙江大学医学院附属第一医院(下简称浙大一院)等机构,研发出了通用医疗影像AI模型——DAMO RADAR。
研究结果显示,仅需一次腹部增强CT扫描,RADAR就可以识别146种病症、覆盖18个器官,其诊断平均准确率(AUC)达到0.913,达到高年资影像科专家的诊断水平。
这是《科学》历史上罕见发表的医疗影像AI论文。此前,仅靠一张CT就同时识别上百种疾病,这几乎被认为是一项“不可能完成的任务”。RADAR的诞生,标志着医疗影像AI完成了从“一病一模”到“一个模型看所有病”的范式转变。
“这是我们影像医生等了很多年,却一直觉得不可能实现的事。但现在,它真的变成了现实。”研究主要作者之一、浙大一院放射科主任肖文波说。
一次CT,看清146种病
腹部CT,是临床上最常用的影像检查手段之一,它广泛应用于门诊、体检、急诊等各类场景。一张影像的背后,往往关联着十几个乃至数十个器官的健康状况。
但对医生来说,要彻底读懂一张腹部CT,挖掘出其中所有隐藏的细节信息,从来不是一件轻松的事。腹部器官几乎都是软组织,密度相近,很多时候,一个关键病灶和周围正常组织之间只有极其细微的差异。
不仅如此,腹部涉及消化、泌尿、生殖等多个系统,几乎所有器官都挤在同一组影像里。一次增强CT,往往包含多个不同期相、每个期相上百幅图像,医生需要逐一排查,才能形成一份完整的诊断报告。
而RADAR的问世,正是为了同时解决这两个难题——诊断的准确性和阅片的效率。
根据此次发布在《科学》的研究结果:在内部真实世界测试中,团队连续纳入了来自浙江大学医学院附属第一医院的39160例病例,覆盖18个解剖结构、146种影像学表现,结果显示,RADAR的平均AUC达到0.913。
此外,在8个外部中心、24239例CT的多中心验证中,平均AUC为0.895,且在每个单独中心都优于对比模型。而在美国斯坦福医院的公开数据集上,针对21种可比病症,无需任何微调,RADAR的AUC也达到0.883。
“这几组数据,分别回答了几个不同的问题。”达摩院高级算法专家张建鹏对“医学界”解释,“内部测试是为了验证AI模型能不能真正学到疾病特征,而不是简单记住训练数据。而随后开展的外部多中心验证,则考验模型能不能跨地区、跨医院泛化。”
事实上,医疗AI最容易出现的问题,就是换一家医院、换一批人群,性能就掉下去。“我们同时开展的跨人群测试(美国斯坦福医院),再次证明了,这套方法在完全陌生的人群和设备条件下,依然是有效的。”张建鹏说。
值得一提的是,即便是训练数据里没有覆盖的场景,RADAR依然保持住了性能。
此次研究结果显示,在27267例急诊测试中,针对17种常见急腹症,RADAR的AUC达到0.904。而在肝癌、胰腺癌、胃癌、结直肠癌四种病理确诊病例中,AUC达到0.891-0.984,证明这套基于报告文本训练出来的模型,同样经得起病理金标准的检验。
此外,在一项由14家医院26名放射科医生参与的阅片研究中,借助RADAR辅助后,医生的诊断灵敏度提升约10%,阅片时间减少30.7%;即便是初级医生,表现也能接近,甚至超过资深医生。
“最初我听到这个数据,有点不太敢相信。”肖文波坦言,这么多器官、这么多期相的结构,一次性识别146种病灶,“我这么多年做医生,都得反复重建、仔细去看才能确保没有遗漏。”
“我们影像医生有一句话,叫‘同病异影、异病同影’。”肖文波解释,同一种病,在不同患者身上可能长得完全不同,不同的病,却可能在影像上表现得一模一样。
“无论医生水平有多高,要想对所有疾病的影像学细节特征——无论常见还是罕见都有丰富的经验,那得看过几十万张片子才行,而这可能是人一辈子都积累不到的量。”肖文波说。
这道人类经验难以跨越的门槛,恰恰是RADAR最擅长的地方。AI不需要一辈子的临床积累,就能从海量真实病例中,学到远超单个医生经验范围的判断依据。
从“一病一模”到“一个模型看所有病”
“在我们科室所有的年轻医生中,最害怕进的组,就是腹部组。”肖文波告诉“医学界”。
据肖文波介绍,她所在的浙大一院放射科有300多名医生、70多台设备,每天需要承接七八千位患者。从年轻医生进科到能独立审核报告,往往要先经过胸部组和其他器官组的历练,最后才敢进腹部组。
“即使是一个中高级水平的医生,写一个腹部CT报告,也需要约20分钟,绝大部分都要20分钟到半小时才能处理完。”肖文波说。
事实上,其他部位病症的影像筛查,比如肺部的肺结节,早已有相对成熟的AI辅助工具,但腹部却长期是个空白。
达摩院团队也注意到了这种情况。最初,团队走的是另一条路——像肺结节AI那样,一个疾病训练一个模型。过去几年,利用“平扫CT+AI”,团队陆续在胰腺癌、胃癌、肠癌等消化系统重大疾病上取得突破,相关成果4次登上《自然·医学》。
但张建鹏告诉“医学界”:“在我们做到第二个单病种项目时,开始渐渐意识到,如果一直沿着‘一个疾病训练一个模型’的路线走下去,那这辈子都干不完。”
“人类的疾病成千上万种,现实中,一张CT影像里往往同时存在多个器官、多种异常。但如果我们两三年只能做一个病种,那医学AI要什么时候才能真正进入临床的主流程?”张建鹏说。
这个疑问,也和整个行业的技术演进撞在了一起。
达摩院资深算法专家张灵对“医学界”介绍,医疗影像AI大致经历了三个阶段。从早期“一病一模”的专才模型,到尝试用结构化标注让一个模型学习多种病,但依然依赖大量人工标注且难以泛化到未见过的疾病类型。
直到近几年,图文对比学习技术成熟,才让“零样本泛化”第一次成为可能。通俗而言,模型不再需要人去提前标注好某种疾病,也能通过学习影像和诊断报告之间的关联,回答关于任何疾病的提问。
可要真正把这条路走通,还需要解决一个关键问题:怎么让AI在腹部CT这种高度复杂的影像里,找到自己该看的地方。
张建鹏解释,最初,团队尝试把整张CT和整份报告直接对齐,但效果并不理想——真正决定诊断的异常病灶,在整个三维体数据里往往只占极小一部分,很容易被大量正常组织淹没。
“后来我们意识到,放射科医生阅片时,是按解剖结构一步步展开的。先看肝脏,再看胰腺、胆道、肾脏,再逐一形成判断。”张建鹏说,“于是,团队把这套逻辑‘教’给了AI,将CT体数据拆解成器官级别的单元,把报告也拆解成对应的解剖学描述,在器官这个更精细的颗粒度上做图文对齐。”
“单病种AI有点像只刷过某一种题型的学生。RADAR更像是在系统性学习医学影像这门语言。”张建鹏比喻道。
这条路径最终被证明是可行的。
肖文波表示,在研发过程的对比实验中,当团队把临床信息,包括病史、主诉等都排除掉后,医生单纯看影像的诊断率其实并不理想。但当接入了AI辅助,医生的检出率和准确率得到了大幅提高。
“当时我们真的特别惊喜,就希望能赶紧上线,期待能装到工作站上,日常用起来。我也曾在一场同行会议上分享这个结果,下面专家的反应是,‘能不能给我们装一个?’”
“如今这项研究成果被Science接收,更是告诉大家,这种形式的AI创新是可以实现的。”肖文波说。
这是不是医疗影像的“ChatGPT时刻”?
“我们还没到真正的腹部CT影像的ChatGPT时刻,但已经是在前夕了。”张灵告诉“医学界”。
此前,达摩院团队研发的单病种“平扫CT+AI”模型,输入的是一张图,输出的只是一个概率。“而RADAR可以像ChatGPT一样,用提示词去提问,模型就能直接给出诊断。而这两者背后,也都是基于大规模预训练得到的模型能力,是有相似之处的。”张灵说。
但相比ChatGPT这样面向大众的通用工具,张灵坦言,医疗是一个容错率极低的领域,RADAR要真正类比像ChatGPT那样,能被医疗场景广泛使用,中间还差着一段距离,包括临床监管审批、工作流的嵌入、更好的可解释性,都是接下来要跨过的关卡。
“这不是一次技术上的终点,而是一个开端。”张灵表示。
这个开端,本身也有一层特殊的意义。据张灵介绍,此前放射学、病理、内镜、皮肤等各类医学影像AI,都极少能在《科学》上发表论文,RADAR的发表,“说明Science开始逐渐把医学图像AI,当作一个医学科学的问题,而不是一个更偏工程学的问题”。
除此之外,RADAR采用的这套“器官级细粒度对齐”的方法论,理论上也不只适用于腹部CT。据张灵透露,接下来,团队还会往胸部CT、脑部CT等部位延伸,乃至迁移到核磁、PET-CT、超声等其他影像模态。
据了解,此次达摩院还将RADAR模型和代码开源,希望未来能成为行业里一个开放的基础平台。
技术往前走的同时,作为临床医生,肖文波也提出了自己的忧虑。她观察到,在借助AI辅助后,年轻医生的报告可以达到主任医师的水平,但AI一旦撤掉,水平又会打回原形。“我们需要警惕一个情况,就是应用AI之后,医生产生了惰性,更加依赖软件,而从年轻医生培养到一个成熟医生的训练过程,反而被忽略掉了。”
面对这种情况,肖文波认为,医生要做的,不是拒绝AI,而是换一种用法——先独立完成报告,再用AI做一次“自我复核”,把AI变成一个“隐形”的带教老师,“我希望这个AI,不但能帮助我们的临床工作,也能帮助我们的教学工作。”肖文波说。
用AI从CT中识别出肉眼难见的微小病灶,从胰腺癌、胃癌、肠癌、肝癌、食管……到这次的通用模型RADAR,达摩院团队用近十年时间,走出了很多人认为不可能的一条路。但眼下,RADAR在146种疾病中的表现,只是被系统性验证过的一小部分。它最终指向的,或许是一个更加宏大的愿景。
“这个模型本身,还具备诊断更多疾病的能力,只是还需要进一步的评估。”张灵说,“接下来,我们还会继续深入研究,让AI能够结合患者的临床信息、医学指南,甚至新的临床试验结果,做出综合的推理,朝‘AI影像医生智能体’演进。”
本文来源丨医学界
责任编辑丨柏柏
*“医学界”力求所发表内容专业、可靠,但不对内容的准确性做出承诺;请相关各方在采用或以此作为决策依据时另行核查。
热门跟贴