《柳叶刀·数字医疗》2026 年 9 月 10 日在线发表了一项中国 5 家中心做的随机对照试验(注册号 ChiCTR2200063424)。受试的是一套叫 PAICS 的胎儿产前超声人工智能系统,考的是它能不能帮超声医生多查出胎儿颅内畸形。1584 次扫查做下来,答案是能,但幅度有限:以胎儿为单位统计,敏感度提高 8.7 个百分点(95% CI 2.9–14.7 个百分点);以每一处畸形为单位统计,提高 11.8 个百分点(95% CI 5.4–18.1 个百分点)。
这个数字容易让两拨人同时失望。指望 AI 兜底的孕妇会问,就多出这么点?担心机器抢饭碗的医生会说,看,还是得靠人。两种反应都跳过了中间那一步:这 8.7 个百分点是从哪儿省出来的,剩下没被省下的那部分又卡在哪儿。这才是这项试验对普通人有用的地方。
AI 盯着的是那一帧画面,不是那个胎儿
PAICS 2022 年发表在 Ultrasound in Obstetrics & Gynecology 上的原始研究写得很直白:它是在标准超声切面图像上识别异常图像模式的实时卷积神经网络,认识 10 种颅内图像模式。训练用了 16 297 例妊娠的 43 890 张图像。
能不能切到标准切面,决定了这套系统有没有活干。胎儿颅脑的超声筛查,医生要在孕妇肚皮上移动探头,从一团不断晃动的灰白影像里,找到几个约定俗成的横切面:丘脑水平横切面、侧脑室水平横切面、小脑水平横切面。只有切到这些平面,脑中线、透明隔腔、侧脑室后角、小脑蚓部这些结构才会按解剖关系排在同一张图上,异常与否才有比对的基准。
AI 接手的是切到之后的事。探头送出的那一帧画面进来,它在 0.025 秒内判断这一帧上有没有它认识的那 10 种异常模式,然后在屏幕上框出来。专家读同一张图平均要 4.4 秒。所以它快,而且在图像上的判别能力确实接近专家:原始研究里,实时扫查场景下的宏平均 AUC 是 0.969,微平均 0.981。
但探头在谁手里?在医生手里。胎位是枕后位还是面朝下、孕周多大、孕妇腹壁厚不厚、羊水多不多,决定了这几个切面能不能切出来、切出来清不清楚。切不到,AI 面前就没有那一帧画面可看,它不会提醒医生"你还差一个小脑切面"。这就是那 8.7 个百分点的边界所在:AI 补的是"图已经切出来了、异常也在画面里、但医生没认出来"的那一部分;它补不了"压根没扫到那个平面"的那一部分。
这套系统提升的是判读那一环,采集那一环还在医生手上。产前超声的漏诊,这两头都占份额,AI 只握着其中一头。
阅片室里的 9 个百分点,扫查现场也是 8.7 个百分点
同一支团队 2023 年在 npj Digital Medicine 上做过一次纯阅片试验:36 名不同资历的医生,读 709 份已经采集好的图像和视频。不用 AI 时平均准确率 73%,一边扫一边看 AI 提示升到 80%,先自己读完再看 AI 提示升到 82%。
两次试验的设计差得很远,一次是坐在屏幕前读现成资料,一次是拿着探头扫活人,但增量落在同一个量级上:阅片试验 7 到 9 个百分点,扫查试验 8.7 个百分点。如果 AI 的增益主要来自"帮医生在现场找结构",那么从静态阅片换到实时扫查,增量应该明显变样。它没有变样,更像是这套系统在两种场景下干的是同一个活:对着已经成像的画面做二次判读。
2023 年那次阅片试验还有一栏数字:中位阅片时间从 6 秒变成 7 秒(同步模式)和 11 秒(先独立读再看 AI)。准确率最高的那种用法,耗时接近翻倍。门诊量摆在那里,这一秒一秒的成本决定了医院愿不愿意按最优方式用它。
这项试验为什么专门设了一条"别乱报"的红线
主要终点里,敏感度做的是优效检验,特异度做的是非劣检验,界值 5%。这样设计,是因为有一个具体的担心。
报警器装上以后,人会顺着报警走。屏幕上框出一块区域,医生的注意力会被拉过去,判"有问题"的门槛会往下挪。在多数临床场景里,多一点假阳性换来少一点漏诊,这笔账算得过来。产前不太一样。一个假阳性提示意味着孕妇要被叫回来复查、可能加做胎儿颅脑磁共振、可能被建议做羊膜腔穿刺,中间隔着两三周等结果的时间。这段时间里的焦虑,以及穿刺本身的风险,都是实打实的代价。
所以要证明的有两条:多查出来的是真的,同时没有把正常的误报成异常。结果是特异度差值在胎儿层面为 +0.9 个百分点(95% CI −0.6 到 +2.3 个百分点),在畸形层面为 +0.1 个百分点(95% CI −0.1 到 +0.2 个百分点),都没有往下掉,非劣性成立(p 均 <0.0001)。研究也未报告与诊断操作或 AI 辅助相关的不良事件。
敏感度涨了多少、特异度有没有往下掉,两个数字都满足,才谈得上可用。只看检出率涨了多少,等于只算收益不算代价。
为什么要让同一个医生隔四周再读一遍
这项试验的设计叫自身交叉(self-crossover)。同一位医生,一段时间用 AI、一段时间不用,中间隔 4 周洗脱期,随机决定谁先谁后。参考标准是专家组事后看录像给出的诊断。
这么绕有它的道理。超声是高度依赖操作者的检查,医生与医生之间的水平差距,往往比"有没有 AI"这个因素大得多。如果简单地把医生分成两组比,结果很可能被分组时的手气左右。让每个医生当自己的对照,这个干扰就被消掉了。
洗脱期针对的是另一种污染:学习效应。医生用过几周 AI 之后,会把 AI 反复框出的那些图像特征记住,再让他"独立"读,他其实已经带着 AI 教过的眼光。隔 4 周,是想把这种记忆冲淡一些。这只是淡一些,不可能完全清零,这也是这类人机协作研究共同的软肋。
这套设计也解释了为什么这类研究做得慢。入组从 2022 年 9 月拖到 2023 年 11 月,1584 次扫查,一年多。
这个结论能覆盖谁
看完数字,更要看清它管到哪儿为止。
人群:入组的是高危单胎妊娠、孕 11 至 32 周。所谓高危,指的是本来就有指征需要更仔细排查的孕妇。普通低危人群的常规大排畸能不能照搬这个结果,这项试验没有回答。低危人群里畸形本来就少,同一套系统在低患病率环境下的假阳性负担通常会更重。
病种:只测了 10 种颅内畸形。心脏、脊柱、四肢、腹壁、泌尿系统这些同样重要的部位,不在这套系统的识别范围里。摘要提到研究还想看看它对识别范围之外异常的影响,但没有给出这部分数字,全文我这里读不到,所以不展开。
医生:参与的是有 3 年到不足 8 年经验的中间层医生。刚上手的新人和做了二十年的专家,能从 AI 身上拿到的增量大概率不一样,这项试验没有分层回答。
终点:主要终点是检出的敏感度和特异度,不是妊娠结局。多查出来的这些畸形,最后有多少改变了处理方式、改善了结局,需要另做研究。
第一,AI 现在的位置是助手,不是第二个医生。它在医生已经获得的画面上做提示,医生的手法和耐心仍然决定了上限。选医院时问"有没有 AI 辅助",不如关心这家机构的产前超声医生够不够、一个孕妇排多长时间。
第二,超声查不出全部畸形,这一点不会因为加了 AI 而改变。加上 AI 的这一组,敏感度离全部查出还差得很远。产前筛查报告上写的"未见明显异常",含义始终是"在这次检查能看到的范围内没有发现问题"。
第三,如果被叫回去复查,先别把它当成坏消息。假阳性在筛查里是常态,这项试验特意去证明 AI 没有把假阳性推高,也说明大家都清楚假阳性的分量。按医生的安排做下一步检查,比在网上搜图对照更有用。
第四,对做超声的同行,这项试验给的启发也许在耗时那一栏:准确率最高的是"先独立判读、再看 AI"这种模式,代价是阅片时间接近翻倍。怎么在门诊节奏里安排这个顺序,比讨论 AI 强不强更实际。
参考来源
① Lei T, et al. Lancet Digit Health 2026 (PAICS randomised trial, ChiCTR2200063424)
② Lin M, et al. Ultrasound Obstet Gynecol 2022;59:304-316 (PAICS development and validation)
③ Lin M, et al. NPJ Digit Med 2023;6:191 (PAICS reader crossover trial, ChiCTR2100048233)
AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。
热门跟贴