*仅供医学专业人士阅读参考
能预测≠可信赖:AI进卒中病房前,必须先回答这三个问题
撰文|医学界报道组
人工智能正在快速进入急性卒中(中风)的诊疗流程。从CT上自动识别大血管闭塞,到计算阿尔伯塔卒中项目早期CT评分(ASPECTS),再到预测患者3个月后的功能恢复情况,AI的表现已经相当亮眼——部分集成模型的准确率可达90%~97%[1]。但在这份亮眼成绩单背后,有一个问题正被越来越多研究者关注:这些模型对所有人都一样准吗?
近期发表在Stroke上的一篇综述,系统梳理了可解释人工智能(XAI)与公平性在急性卒中管理中的研究现状,指出了几个关键缺口:模型决策过程不透明、公平性评估严重不足、不同人群间的性能差异被忽视[2]。这些问题如果得不到解决,AI可能会在无意中放大本已存在的医疗不平等。
图:研究截图[2]
AI在卒中领域已经能做什么?
先看成绩。在急性卒中影像分析中,深度学习模型已展现出强大能力。比如,有研究用二维卷积神经网络检测颅内出血,在外部数据集上曲线下面积(AUC)达到0.96,并用梯度加权类激活映射(Grad-CAM)标出模型认为最重要的区域[3]。另一项研究将Grad-CAM++集成到MaxViT视觉Transformer中,用于CT上的卒中亚型分类,F1分数达到98.00%[4]。
在预后预测方面,可解释性方法应用更多。有研究者开发了一个梯度提升模型,预测急性缺血性卒中患者3个月功能结局,AUC达到0.91,并通过SHAP分析识别出美国国立卫生研究院卒中量表(NIHSS)评分、年龄和ASPECTS是最有影响力的预测因子[5]。有研究用沙普利加性解释(SHAP)解释集成模型和神经网络模型,发现高血压、平均血糖水平和年龄是卒中风险的主要贡献因素[6]。
这些研究说明,AI确实能从复杂的临床和影像数据中挖掘出有价值的信息。但“能预测”和“可信赖”之间,还隔着几道坎。
第一道坎:模型是个“黑箱”,解释未必可靠
深度学习模型常被称为“黑箱”——它给出预测,但不告诉你为什么。XAI就是试图打开这个黑箱的工具。目前最常用的两类方法是:针对表格数据的SHAP,和针对影像的Grad-CAM等梯度可视化方法。
但问题在于,这些解释本身可能不可靠。
综述指出,当前的XAI方法大多属于事后解释,存在近似误差,可能突出模型“看哪里”而非“真正依赖什么”[2]。更麻烦的是,SHAP解释可以被操纵,呈现出看似合理但具有误导性的结果;显著性图即使在预测错误或大幅改变时,视觉上仍可能显得很合理[2]。这意味着,临床医生如果过度信任这些解释,可能被带入确认偏误——把模型高亮的区域当成有临床意义的证据,而实际上那并不是模型真正的决策依据。
Cecil等人甚至发现,提供解释并没有减轻错误AI建议带来的负面影响,也没有减少使用者对错误输出的过度依赖[7]。换句话说,有解释≠可信,解释本身也需要被验证。
第二道坎:公平性评估几乎空白
比“黑箱”更值得警惕的,是公平性问题。
卒中的负担在不同人群中并不均等。有研究显示,社会经济地位较低的人群卒中发病率高出约30%,急性期神经功能缺损更重,功能恢复更差,死亡率更高[8]。在治疗层面,黑人和西班牙裔患者接受血管内治疗的机会更低,90天功能独立的比例也更差;女性接受组织型纤溶酶原激活剂(tPA)单药治疗后住院死亡率更高;非白人患者接受tPA或血管内治疗后住院时间更长、出院回家比例更低[9,10]。
如果AI模型训练数据本身有偏,或者评估时没有按人群分层,就可能复制甚至放大这些差异。
但综述对2021~2026年相关文献的梳理显示,明确进行公平性评估的卒中AI研究极少。在纳入分析的众多研究中,只有8项以某种形式涉及公平性,且多数只是对标准性能指标做亚组分析,而非使用正式的公平性指标或公平感知训练[2]。种族/族裔作为受保护属性被考察的只有4项研究,社会经济地位则一项都没有[2]。
这里需要区分一个关键概念,亚组间性能差异不等于偏见。差异可能反映真实的临床差异,也可能掩盖偏见。要区分二者,必须探究差异背后的原因,而不能简单地把性能差距当作偏见存在的证据[2]。
第三道坎:数据本身“先天不足”
公平性评估难以开展,一个现实障碍是人口学元数据缺失。
许多公开的卒中数据集,包括被广泛使用的Kaggle卒中数据集,缺少种族和族裔信息,无法进行公平性分析[2]。更令人担忧的是,有研究对该数据集的可信度提出质疑,指出其缺乏可验证的数据来源,甚至有迹象表明数据可能是合成或伪造的[11]。
影像数据集的情况类似。常用的开源卒中影像数据集大多不包含人口学元数据,或仅提供年龄、性别等有限属性[2]。这意味着,仅用解剖影像训练的模型,可能看起来“没有偏见”,但实际上根本没有经过公平性审计。而Gichoya等人的研究已经证明,深度学习模型可以仅凭医学影像高精度预测患者自我报告的种族,跨越多种成像模态[12]。卒中影像模型是否也存在类似的隐含人口学编码,目前尚不清楚——这是一个关键的知识空白。
地理分布不均也是问题。一项对27项卒中机器学习研究的综述发现,研究队列集中在美国少数几个州,尤其是加利福尼亚州(25.9%)和马萨诸塞州(11.1%),而卒中负担最重的密西西比、路易斯安那和阿拉巴马等州却鲜有覆盖[2]。在这种错配下训练的模型,可能对高负担地区泛化很差,并把更差的结果错误归因于个体因素,而忽视更广泛的社会健康决定因素。
法规限制也加剧了困境。欧盟《通用数据保护条例》限制收集敏感数据,美国《健康保险流通与责任法案》的去标识化要求可能削减少公平性评估所需的人口学细节[2]。开放卒中数据集需要在隐私保护和保留人口学信息之间取得平衡,但匿名化实践往往会泛化或限制这些元数据。
有没有做得好的例子?
有,但很少。
有研究使用亚组特异性校准分析,通过观察值与预期值的比值来量化模型是否系统性地高估或低估风险,并用一致性指数评估模型对个体风险的排序能力。结果发现,尽管黑人个体的事件率更高,但所有模型在黑人中的区分能力都更差[13]。
有研究引入了组条件一致性指数,用于时间-事件场景下的公平性量化,评估模型在跨亚组比较个体时是否保持一致的区分性能[14]。
有研究在房颤患者2年卒中风险预测中,使用了算法文献中的公平性指标,包括机会均等差异、不同影响、性能差异和假阳性率比值,并通过公平感知调优标准、代表性调优集构建和亚组特异性分类阈值来缓解种族差异[15]。
这些研究是有意义的尝试,但综述指出,它们仍然是“孤立努力”,整个领域尚未系统性地优先考虑公平性[2]。
出路在哪里?
综述给出了近期和长期的优先事项。
近期,需要在模型开发早期就纳入多元利益相关者,包括临床医生、工程师、社会科学家以及来自服务不足人群的患者代表。公平性指标、亚组分析和事后可解释性技术应当补充而非替代人类判断。卒中领域需要共识标准,明确队列人口学、公平性指标和校准的最低报告要求,以提高研究间的可比性。
技术层面,公平性干预应贯穿整个建模流程。预处理阶段通过针对性收集和公平过采样方法确保训练数据多样性;处理中阶段探索非歧视正则化、约束优化、对抗性去偏和基于奖励的强化学习等公平感知训练方法;后处理阶段可通过调整决策阈值来满足公平性指标。Fairlearn和AI Fairness 360等开源工具包提供了可访问的公平性评估和偏见缓解接口[16,17]。
可解释性与公平性需要联合评估。一个模型可能预测结果公平,但对不同群体提供的解释质量不同,而标准公平性指标可能漏掉这种差异。有研究将这种差异形式化为“过程导向公平”(相对于“结果导向公平”),并提出了量化指标[18]。将类似指标适配到卒中AI,可以评估XAI输出在不同患者亚组间是否具有可比质量。
长期,需要建立跨机构、跨国家的去标识化患者级数据共享框架,联邦学习策略是在法规限制下直接数据共享的替代方案。未来的卒中AI系统应在训练过程中直接纳入公平性目标,并配合标准化的部署后审计,确保随着患者人群和临床实践演变,预测性能和公平性都能持续保持。
结语
AI在急性卒中管理中的潜力毋庸置疑:更快的诊断、更准的预测、更个性化的治疗。但这些进步能否真正惠及所有患者,取决于我们能否解决可解释性和算法公平性问题。
一个在总体人群中将AUC做到0.95的模型,如果在某个族群中区分能力显著下降,那它的“优秀”就是有条件的。一个能给出漂亮热力图的模型,如果热力图高亮的区域并非其真正决策依据,那它的“透明”就是表面的。
综述的核心信息很明确,可解释性本身不保证公平性,公平性评估也不能替代可解释性。只有将泛化性、可解释性和公平性放在同一个评估框架下联合考察,才能开发出真正可信赖、惠及所有卒中患者的AI系统[2]。
参考文献:
[1]Chahine Y, Magoon MJ, Maidu B, et al. Machine learning and the conundrum of stroke risk prediction. Arrhythm Electrophysiol Rev. 2023;12:e07.
[2] Lin J, Aktar M, Baazaui H, et al. Responsible AI for acute stroke management. Stroke. 2026.
[3] Wang X, Shen T, Yang S, et al. A deep learning algorithm for automatic detection and classification of acute intracranial hemorrhages in head CT scans. Neuroimage Clin. 2021;32:102785.
[4] Qari S, Thafar MA. Brain stroke classification using CT scans with transformer-based models and explainable AI. Diagnostics (Basel). 2025;15:2486.
[5] Chen CF, Ren ZY, Zong HH, et al. Development and validation of explainable machine learning models for predicting 3-month functional outcomes in acute ischemic stroke: a SHAP-based approach. Front Neurol. 2025;16:1678815.
[6] Tang X, Tang M, Liu W, et al. Explainable machine learning for stroke risk prediction: a comparative study with SHAP-based interpretation. Front Neurol. 2026;16:1716984.
[7] Cecil J, Lermer E, Hudecek MFC, et al. Explainability does not mitigate the negative impact of incorrect AI advice in a personnel selection task. Sci Rep. 2024;14:9736.
[8] Addo J, Ayerbe L, Mohan KM, et al. Socioeconomic status and stroke: an updated review. Stroke. 2012;43:1186-1191.
[9] Sheriff F, Xu H, Maud A, et al. Temporal trends in racial and ethnic disparities in endovascular therapy in acute ischemic stroke. J Am Heart Assoc. 2022;11:e023212.
[10] Nagaraja N, Olasoji EB, Patel UK. Sex and racial disparity in utilization and outcomes of t-PA and thrombectomy in acute ischemic stroke. J Stroke Cerebrovasc Dis. 2020;29:104954.
[11] Gibson AD, White NM, Collins GS, et al. Evidence of unreliable data and poor data provenance in clinical prediction model research and clinical practice. BMC Med. 2026;24:386.
[12] Gichoya JW, Banerjee I, Bhimireddy AR, et al. AI recognition of patient race in medical imaging: a modelling study. Lancet Digit Health. 2022;4:e406-e414.
[13] Hong C, Pencina MJ, Wojdyla DM, et al. Predictive accuracy of stroke risk prediction models across Black and White race, sex, and age groups. JAMA. 2023;329:306-317.
[14] Engelhard M, Wojdyla D, Wang H, et al. Exploring trade-offs in equitable stroke risk prediction with parity-constrained and race-free models. Artif Intell Med. 2025;164:103130.
[15] Gao J, Mar P, Tang ZZ, et al. Fair prediction of 2-year stroke risk in patients with atrial fibrillation. J Am Med Inform Assoc. 2024;31:2820-2828.
[16] Weerts H, Dudik M, Edgar R, et al. Fairlearn: assessing and improving fairness of AI systems. J Mach Learn Res. 2023;24:257.
[17] Bellamy RKE, Dey K, Hind M, et al. AI Fairness 360: an extensible toolkit for detecting and mitigating algorithmic bias. IBM J Res Dev. 2019;63:4:1-4:15.
[18] Zhao Y, Wang Y, Derr T. Fairness and explainability: bridging the gap towards fair model explanations. In: Proceedings of the Thirty-Seventh AAAI Conference on Artificial Intelligence. AAAI Press; 2023:11363-11371.
责任编辑:老豆芽
*“医学界”力求所发表内容专业、可靠,但不对内容的准确性做出承诺;请相关各方在采用或以此作为决策依据时另行核查。
热门跟贴