患者被警告不要转向人工智能进行居家医疗诊断,因为一些AI系统未能识别关键症状。
美国卡内基梅隆大学计算机科学学院的研究人员调查了GPT-5、Gemini和Claude等大型语言模型如何回应旨在诊断疾病的基础医疗问题。
分析显示,当被问及医生在评估患者时通常会参考的细节时,这些大型语言模型(LLM)偶尔会编造虚假信息。
作为研究的一部分,机器人研究所硕士生西达尔特·沃拉要求主流LLM描述一张在提问中故意被省略的医学图像。
但在18%的案例中,模型并没有要求提供缺失的图像,而是根据用户的年龄、性别和种族虚构了一个诊断。
误导性
研究结果表明,AI提供的诊断中近五分之一可能是虚假或误导性的。
计算机程序还假设一些患者患有癌症,而没有参考可以帮助排除该疾病的关键图像。
“当提出胸片问题时,OpenAI的GPT-5对约77%的年轻黑人患者诊断为结节病。”
癌症专家估计,每1万颗痣中不到一颗会癌变。结节病——一种通常见于肺部的炎症性疾病——较为罕见,每10万人中出现10至60例,部分区域存在差异。
沃拉先生说,当提示词中仅输入种族、年龄或性别时,诊断结果可能会改变。
这项研究突显了在谷歌医生和先进AI时代,自我诊断方法中存在的缺陷。
通过输入症状,患者绕过了专业医疗意见,将自身健康交到计算机程序手中。
尽管AI的回答看起来令人信服且权威,但它们并非基于事实,而且用词的微小变化就可能会极大地影响模型的结论。
在研究过程中,沃拉先生针对12个模拟患者档案,重点关注了胸片、脑部MRI扫描和皮肤科图像。
AI模型在Claude、GPT-5和谷歌Gemini上共提供了11700条回答。这些发现印证了AI行业的一个重大担忧:用户往往认为模型理解的内容远多于其实际所知。
“大约82%的情况下,由于没有附加图像,模型拒绝提供回答,”沃拉先生说。“在剩下的18%中,模型编造了诊断,而不是要求提供缺失的图像。”
“普遍认为AI模型很智能,因为它们在特定任务上表现良好。但擅长一件事并不意味着它们擅长所有事。”
令人信服的诊断
根据2026年爱德曼信任度晴雨表全球报告,在阿联酋受访的1000人中,59%的人曾使用AI来管理自己的健康。该报告还发现,十分之七的人对自己能够找到健康问题的答案并做出明智决定感到有信心。
“大型语言模型在安全防护措施到位之前就已进入医院,”阿联酋技术服务提供商Outworks的首席技术官艾哈迈德·阿舒尔说。
“无论回答是否正确,模型都会生成流利的答案,而在医学领域,一个自信的错误答案比没有答案造成更大的伤害。”
“开发者大多基于西方人群训练模型,因此对地区患者的准确性会下降,从遗传风险因素到患者用阿拉伯语描述的症状都是如此。”
阿舒尔先生表示,数据隐私是阻碍LLM在医疗保健领域发挥效力的另一个问题。“健康记录是国家持有的最敏感数据之一,任何部委都不能将其交给不受其控制的系统,”他说。
“问责制是最后一点。当算法影响临床决策时,必须有人对结果负责,而许多医疗系统目前还无法说出那个人是谁。”
医院
放射学被证明是AI应用最有效的医疗领域。
模型在扫描中标记异常,准确率接近专科医生,这为每张图像提供了第二次判读,而无需增加放射科医生的工作时间。
基于AI的医院系统可以预测住院人数、管理床位容量,并在数小时前发现患者病情恶化,从而在不开处方的情况下拯救生命。
阿斯特DM医疗保健公司数字健康与全渠道业务首席执行官纳拉·卡鲁纳尼蒂表示,该集团的医院利用AI算法帮助放射科医生优先处理紧急病例,并更快地发现细微异常。
“目前大型语言模型真正增值的地方在于临床接触环节,而非诊断决策本身,”卡鲁纳尼蒂先生说。
“通用模型可能带有训练数据中的偏见,包括与族裔和种族相关的偏见,并且可能以完全自信的方式给出错误答案。”
“在临床环境中,这种不负责任的自信目前在临床上并不被鼓励。”
“在阿斯特,任何涉及诊断路径的AI都在医生的监督下运行,医生仍对决策负责。”
热门跟贴