“这位医学生今天负责你的诊疗。别担心,他非常能干,医学院所有考试全部满分,一道题都没错过。你交给他,放心。”
医生这番话,听着是不是哪里不对劲?
这就是AI进入医疗领域时最扎心的那个问题:一个在“考试”里永远满分、在“真实世界”里却没人敢打包票的模型,到底能不能用?
“考得好”和“用得好”之间,隔着一条鸿沟
AI在那些有明确“标准答案”的任务上,已经强得离谱。你给它海量带标注的数据,让它反复训练,它就能把活儿干得比人还漂亮。训练数据和算力给得越多,它就越强。
但这里有个关键:“考试表现好”和“实际表现好”之间的差距越小,AI落地就越靠谱。医疗恰恰是这两者差距最大的领域之一。
医疗AI的梦想蓝图很美好:把“健康”的样子、所有能找到的临床数据都喂给AI,让它比人类更早发现问题、给出更好的建议。这个梦值得追,但有个绕不开的坎——怎么评估“这个AI到底行不行”?
三个原因,让医疗AI的“考卷”根本出不好
第一,医学评估本质上是主观的。临床决策很难变成一套标准化的训练数据。每个医生都有自己的判断习惯和个人风格,这些细节极难统一成标准。你拿临床数据训练AI,设计出来的任何测试标准,其实都带着设计者自己的“偏见”——它衡量的是“当时那位医生做了什么”,而不是“病人这辈子是不是一直健康”。医学里根本没有一个公认的、绝对的“标准答案”。
第二,底层数据都是“黑箱”。所有想搞医疗AI的公司,手里都攥着各种临床和行政数据集,用来训练和测试。这些数据被死死捂着,谁也不愿意公开。别人想验证你的模型好不好,连门都摸不着。
第三,评测和基准最后都会变成营销话术。这不是说公司都在使坏,而是商业世界的自然规律。“模型在基准测试上表现很好”这句话,更多反映的是“你出的题恰好适合它”,而不是“它比别的模型临床更牛”。这本质上是个委托代理问题——出题的人、答题的人和用题的人,根本不是一回事。
唯一靠谱的评估方式,恰恰是最难走的路
想客观判断一个模型当时的决策对不对,只有一个办法:跟着病人往前走,观察足够长的时间。但“观察多久算够”“什么结果算好”,本身又是一个主观判断。
这种评估方式,比单纯建个基准测试然后跑分,要难出好几个量级。也正因为如此,医院和采购方想比较各家AI产品谁更强,变得异常困难——尤其当大家都拿不出长期随访数据的时候。
医疗AI的“预言机问题”就卡在这儿:你没法证明它真的能预测未来,就只能拿过去的考试成绩说事。而病人要的,从来不是一张满分试卷,是一个靠谱的未来。
热门跟贴