打开网易新闻 查看精彩图片

一个芬兰程序员,右肩疼了两三周。不算什么大事。可能就是健身拉伤了,或者睡觉姿势不对。他去看了骨科。

医生让他拍个核磁共振。刚好诊所里就有机器。拍完,医生告诉他:肩胛下肌腱III级撕裂,超过50%的宽度。严重。需要治。几分钟之内,治疗就开始了。

他走出诊所的时候,心里有点不踏实。太快了。从拍片到诊断到治疗,像一条提前铺好的流水线。他唯一做对的事,是在离开之前跟诊所要了MRI的原始文件。266MB,几百个没有任何后缀名的DICOM文件。他不知道自己接下来会拿它们干什么,但他要了。

先让GPT看一眼治疗清单

他没直接把MRI扔给AI。他先把医生做的治疗项目清单发给了GPT-5.5 Pro。几分钟后,GPT指出了两个问题。

具体什么问题他没展开说。但从他文章里的措辞能读出来。GPT的反馈没有让他更安心。相反,它让他更想搞清楚一件事:我到底是不是真的需要这些治疗。

这一步很关键。他不是在找一个比医生更强的AI。他只是在找第二个声音。

打开网易新闻 查看精彩图片

把266MB的MRI文件喂给Claude Code

他用的不是Claude.ai的聊天窗口。是Claude Code——那个给程序员写代码的工具。区别在哪?Claude Code可以运行代码、安装软件包、处理文件,像一个真正在干活的人,不是一个只负责聊天的对话框。

他选了Opus 4.8模型,开了最高推理强度。给AI的指令简单到只有一句话:"右肩疼痛2-3周。"比医生拿到的主诉还少。

然后Claude Code开始干活了。自己装了处理DICOM文件的Python包。读了几百张片子。一个小时后,出了一份报告。

报告说:肌腱完好。没有撕裂。零。

而他的人类医生说的是:III级撕裂,超过50%宽度。

这两个结论之间的距离,不是"轻微差异"能解释的。是"有病"和"没病"的区别。

让AI当裁判

他没有就此下结论。他又做了一轮"仲裁":把人类医生的报告发给AI,把之前跟ChatGPT讨论症状的对话也发给它,让AI重新分析。

这次他换了个策略:让AI启用多个"子代理"分别独立分析,避免它们被同一个上下文带偏。AI拆解了两份报告之间的分歧点,逐个比对,从一个更像"裁判"的视角重新走了遍流程。

又过了一个小时。仲裁报告出来了。

结论:"证据支持分析者A的判断(中高置信度)。轻度肌腱附着点病变。未发现独立的局部或全层撕裂,包括肩胛下肌腱附着处。"

翻译成人话:AI觉得肌腱有点小问题,但不严重。没有撕裂。医生的诊断,大概率是过度解读了。

现在他卡在中间了

所以怎么办。信医生?III级撕裂,治了三次了,花了不少钱。信AI?一个编码工具,读了几百张医学影像,用了一个小时,说没事。

他自己写的原话是:"我现在处于一种中间状态——要么再找另一个医生碰运气,要么等着看肩膀在做康复训练的过程中能不能自己好。"

这不是一个"AI赢了"或者"医生赢了"的故事。这是一个普通人被夹在两头、不知道该往哪边走的故事。

但有意思的是后面的数字。这篇博客发出去之后,Hacker News给了395个赞,514条评论。514条。这些评论大致分成两派:"AI迟早取代医生"和"AI没经过临床验证凭什么信它"。吵了500多条。

我在想的是另一件事。

AI不是来取代医生的,但医生再也回不到"我说了算"的时代了。

FDA这两年已经批了好几款AI辅助诊断工具。谷歌DeepMind的眼科AI在某些指标上超过了人类专家。中国的医疗AI创业公司——推想科技、数坤、联影智能——早就把AI读片送进了几百家医院。

打开网易新闻 查看精彩图片

但这些都不是这篇博客讲的这件事。博客里的这个人,不是医院的AI系统在帮他。是他自己。一个会写代码的普通人,在家里,用自己的电脑,把一个编程工具硬掰成了医学影像分析仪。然后这个临时拼凑出来的东西,给出了一个跟专业医生完全相反的结论。

这不是技术的胜利。也不是技术的失败。

这是一个信号。信号的意思是:当一个有基本技术能力的普通人,可以在家里用消费级的AI工具挑战一个专业医生的诊断。不管AI对还是不对。整个"专业知识只属于穿白大褂的人"的游戏规则,已经裂了一条缝。

如果你明天拍了个MRI

你会多看一个医生吗?会的吧,第二意见嘛,很正常。

你会把片子发给GPT看一眼吗?

我猜很多人已经在做了。