2026年9月17日,Science发表了浙江大学医学院附属第一医院梁廷波团队完成的题为《An expert-level generalist AI for abdominal CT diagnosis》的研究。腹部增强CT涉及的器官多、病变类型杂,诊断很依赖医生经验,现有AI模型大多需要大量人工标注,疾病覆盖和泛化能力有限。该研究构建了RADAR,一个面向增强腹部CT的视觉语言通用模型,它把CT体积拆成解剖单元,和临床报告文本做对齐,无需额外人工标注就能完成多器官、多征象诊断,并给出注意力图。

打开网易新闻 查看精彩图片

RAD-CT数据集包含424,911次检查、1,496,973体积层面图文对,并衍生出超过1,500万解剖层面图文对,RADAR在18个解剖结构和146个影像发现上训练和评估。模型用正负提示比较余弦相似度,推理时不需要针对任务重新训练,内部39,160次连续检查上平均AUC为0.913,95% CI为0.911到0.915,比次优fVLM的0.776高0.137,P<0.001。18个解剖结构AUC为0.838到0.982,实体器官平均0.918,空腔器官0.907,疾病与征象分别为0.914和0.911,并且优于ViT和nnUNet+等监督学习模型,低频发现的优势更明显。

打开网易新闻 查看精彩图片

外部八中心24,239次检查上,RADAR平均AUC为0.895,单中心0.874到0.912,全部高于三个基线模型。病理确认的肝、胰、胃、结直肠癌队列共4,333例,AUC为0.891到0.984;八中心里这四类癌AUC分别约0.905到0.987、0.909到0.989、0.899到0.987、0.863到0.974。急诊27,267例、17种急性腹部疾病,AUC为0.904,模型未用急诊数据训练。跨人群Merlin-CT-Test的21个可解剖对应发现上,零样本AUC为0.883,训练后0.888,RADAR+微调后0.918,30个发现全覆盖时0.876。

读者研究纳入26名14家中心放射科医生、300例、61个发现,无辅助时特异性98.8%,敏感性随经验和医院层级差异大;RADAR辅助后敏感性提高10.0%,P<0.001,特异性98.2%,阅读时间减少30.7%,P<0.001。基层和低年资医生提升更明显,急诊、恶性、空腔器官病变也有增益。提示集成把内部AUC从0.913提到0.928,P<0.001;findings prompt alignment微调后内部0.940、外部0.927。研究团队认为,大规模视觉语言学习可减少人工标注依赖,并提升腹部CT诊断覆盖和可解释性。

READING

BioPeers