在当下的医疗体系中,人的健康问题通常被拆分成一个个更具体的问题:有没有糖尿病?心血管疾病风险有多高?是否出现了阿尔茨海默病的早期迹象?
但实际上,人的健康并不是这些疾病的简单相加。诊断记录、血液检查、蛋白质组、代谢组、影像,这些指标每一项测量都只能看到身体状态的一个侧面,而且发生在不同的时间点:血液指标可能几个月测一次,核磁共振成像(MRI)可能相隔数年,诊断则要等到疾病被临床识别后才会进入病历。
现有医学AI往往只利用某一个时间点的数据,或者针对预先定义的疾病单独建模,很难从这些零散、异步的证据中还原出一个人完整的健康轨迹。也就是说,真正决定一个人未来疾病风险的“健康状态”始终存在,却很难被直接观测。
近日,来自斯坦福大学、哈佛大学、华盛顿大学等机构的研究团队开发了首个泛模态(pan-modal)人类健康世界模型HealthFlux。与传统针对单一疾病分别训练风险模型的方法不同,HealthFlux试图学习一个统一的、隐含的人体健康状态(latent state),并建模这一状态如何随着年龄、疾病和生物学变化持续演化。
据了解,这项研究由斯坦福大学研究团队牵头,来自哈佛大学、华盛顿大学、宾夕法尼亚大学、麻省理工学院、牛津大学和卡罗林斯卡医学院等机构的研究人员共同参与。
图丨应可钧(来源:受访者)
共同通讯作者应可钧博士毕业于哈佛大学,目前在斯坦福大学托尼·怀斯-科雷(Tony Wyss-Coray)实验室和华盛顿大学大卫·贝克(David Baker)实验室从事博士后研究,将于明年1月加入斯坦福大学医学院担任终身教轨助理教授,并兼任计算与AI实验室主任。
图丨相关论文发表在预印本网站medRxiv(来源:medRxiv)
下一个“AlphaFold时刻”
会出现在人的健康上吗?
生物学本身是多尺度的,从分子到细胞和组织,再到个体乃至群体健康,每个尺度都可能建立相应的虚拟生物学模型。在分子尺度,一个典型的例子是AlphaFold。此后,一个自然的问题是:生物学的下一个“AlphaFold时刻”会出现在哪里?
虚拟细胞(virtual cell)是目前受到广泛关注的方向之一。应可钧对信睿科技评论表示:“如果能够建立足够准确的细胞模型,就可能预测不同干预之后细胞状态如何变化。类似的思路也正在向虚拟组织(virtual tissue)延伸。”
但应可钧和团队将研究目标聚焦到了另一个尺度——人的整体健康。在他看来,不同尺度上的数据和建模条件像一个沙漏。在分子端,DNA序列、蛋白质结构这样的数据已经很接近研究对象的物理形式;到了细胞和器官尺度,要完整、动态地观察一个系统变得困难得多,很多组学数据仍然只是某个时刻、某个分子层面的截面;再到个体和群体端,大型队列和长期健康记录又提供了大量可以学习的健康轨迹。
因此研究团队认为,另一个可能出现突破的方向,是建立对人的整体健康状态的计算表示。此前,已经有相关研究尝试把人的一生处理成类似语言的序列:每一次疾病、诊断等事件都被视为一个Token,模型读取此前发生的事件,再预测接下来可能发生什么。
应可钧指出:“句子是离散的,但人的健康状态是一个持续演化的状态,实际上是一种潜变量,因此人的健康并不完全像‘一句话’。”
如果模型只预测一个个离散事件,那么两个事件之间身体究竟发生了什么,就很难被描述。与此同时,一个人的健康也远不只是疾病史。血液检查、MRI、代谢组、蛋白质组、遗传信息、用药史和生活方式等,都可能反映身体状态的一部分。
图丨HealthFlux从异步多模态记录中学习健康的潜在动态特性(来源:medRxiv)
HealthFlux试图解决的正是这两个问题:如何把大量不同模态的信息整合起来,以及如何描述健康状态在时间上的连续变化。因此,团队选择了“世界模型”的思路。
世界模型的任务,是维持一个关于系统内部状态的表示(即模型对环境中物体、位置、运动及其相互关系等信息的内部编码),预测这个状态如何变化,并在新的观测出现后不断更新它。以视频世界模型为例,模型不仅需要接收图像、声音等不同模态的信息,还需要维持对场景内部状态的表示。如果再加入一个动作,例如改变观察方向,后续生成的世界也应随之改变。
HealthFlux将类似逻辑移植到了人体。模型将纵向临床记录、遗传、血液生化、血液学、蛋白质组、代谢组、生理功能、生活方式以及脑和腹部MRI等11类数据整合起来。这项研究相关结果显示,这些数据包含5647项特征,主要来自超过50万名英国生物银行(UK Biobank)参与者。
图丨基于持续且可修正的健康状态进行疾病预测(来源:medRxiv)
不同模态首先通过各自的编码器被压缩成统一的表示,再进一步融合。从本质上来看,它是一个表征学习的问题。模型将组学、遗传、疾病记录和影像等不同信息编码并融合,形成一个共享的健康状态表示。在当前架构中,这一潜在状态由256维确定性表示和128维随机表示共同构成,总计384维。
当新的检查、诊断等事件出现时,模型会更新这个状态;而在两次记录之间,则通过基于神经常微分方程(neural ODE)的模型架构持续推演其变化。需要了解的是,身体不会因为没有去医院检查而停止变化。
而HealthFlux试图描述的,恰恰是那些没有检测数据的时间里,一个人的健康状态继续演化的过程。
它的另一个关键设计,是把“人的健康状态”和“疾病的定义”分开。在最严格的实验中,研究团队把某些疾病从训练过程中完全移除,模型对这些从未见过的疾病仍然达到0.783的平均 AUROC(注:衡量模型区分患病与未患病个体能力的指标,数值越接近1,区分能力越强;0.5相当于随机猜测)。研究团队认为,这正是模型学到的是“健康本身”而非训练用的那些疾病的证据。
不只是预测疾病
而是模拟一条健康轨迹
这种建模方式首先反映在疾病风险预测上。据介绍,在1010种疾病和死亡共1011个预测终点上,HealthFlux取得了0.832的五年平均AUROC,高于此次比较中表现最好的RisQ模型(0.805)。该结果在三个独立队列中得到验证,模型也优于针对特定疾病和死亡专门设计的临床风险评分。
它更重要的能力之一,是识别高风险人群。例如,当模型挑出风险排名前1%的人群时,在一些疾病上,这部分人的实际风险可能达到普通人群的20倍、40倍甚至50倍。“实际上你可以用这个模型去找这种极高风险个体。”应可钧说。
表丨疾病预测与迁移评估(来源:medRxiv)
这也是他认为HealthFlux可能与预防医学发生联系的地方。与长期预测相比,短期预测通常更加准确。应可钧认为,如果未来模型能够稳定地提前数月识别中风等关键疾病事件的高风险人群,可能为进一步检查和干预留出更多时间。
HealthFlux的目标,不只是某一个时间点的风险评分。在这项研究中,研究团队进一步测试了它的长程模拟能力:在不再向模型提供真实后续观测的情况下,让它自己预测下一个诊断及其发生时间,再把生成的事件重新输入模型,继续向未来推演。
测试中的递归模拟最长延伸到了20年。也就是说,HealthFlux试图模拟的是一条健康轨迹:随着年龄增长,一个人的内部状态怎样变化,什么时候可能出现疾病,而一次新的诊断又会怎样改变模型对其健康状态的判断。
多模态信息的价值也体现在这里。一个人在疾病记录中可能看起来风险并不高,但他的代谢组、蛋白质组、影像或者身体功能数据中,可能已经出现另外一些信号。
对未来高血压患者的分析显示,对于不同单一模态模型漏掉的病例,泛模态模型能够重新识别其中27.9%-55.5%。而且,不同模态并不是简单重复同一件事。
该研究发现,血液生化、代谢组和腹部MRI对代谢疾病的预测贡献更加明显;蛋白质组更多贡献于血液和免疫相关疾病;生活方式信息在精神疾病预测中更重要;身体功能则更多参与循环系统疾病的预测。这意味着,“泛模态”并不只是把更多数据堆进模型,而是在尝试从不同角度拼出同一个人的健康状态。
更特别的一项能力,是预测训练阶段没有见过的疾病。HealthFlux把“人的健康状态”和“疾病的定义”分开。同一个健康状态,可以被不同疾病反复查询。疾病也不只是一个简单标签,而是通过包含语义等性质的向量进行表示。
据介绍,即使把部分疾病完全从训练中移除,HealthFlux仍然可以利用已经学到的健康状态以及疾病之间的关系,对这些没有见过的疾病进行预测。“我们想展示的是,该模型学到的健康状态是非常通用的。”应可钧说。
研究人员还进行了更严格的实验:不仅不让疾病预测器看到目标疾病,还将相应诊断从世界模型的输入和训练目标中排除,再重新训练模型。结果仍显示,模型可以对这些被排除的疾病形成一定的预测能力。这种能力也指向一个潜在的应用场景——罕见病。
许多罕见病没有足够多的病例用于单独训练一个预测模型。如果一个模型能够先学习更加通用的人体健康状态,再把这种能力迁移到病例有限甚至训练阶段没有见过的疾病上,可能提供另一条路径。
换句话说,HealthFlux想证明的不只是可预测某些疾病更准,而是这些疾病背后,是否存在一个可以被共同学习的健康表示。
如果让人“吃下一种药”
未来会发生什么?
世界模型还有一个重要特征:它不仅预测系统接下来会发生什么,还可以模拟一个“动作”会怎样改变未来。
在HealthFlux中,研究团队首先尝试把“用药”作为这样的“动作”。同一个人的健康状态由此可以沿着不同路径向前模拟:如果不进行干预,他的状态会怎样变化?如果在某个时间点使用一种药物,又会发生什么?
研究团队以他汀类药物为例,对原本没有服用他汀的人群模拟一次用药事件。模型随后预测出低密度脂蛋白(LDL)等指标下降,同时心脏病和中风风险相较不用药的模拟轨迹降低。降压药的模拟也出现了类似变化。
此外,研究人员还将模型模拟出的部分药物效应与已发表临床试验结果进行了比较。论文整理的比较集包含来自36个试验家族的63个药物-终点效应估计,并进一步分析了模型模拟结果与临床试验结果之间的一致性。不过,这些比较主要用于检验模型能否复现已知药物效应,并不能视为独立的前瞻性临床验证。
在此基础上,研究人员又把模拟扩展到259种药物编码和1256个疾病终点,希望寻找潜在的药物重定位线索,二甲双胍就是其中案例之一。这也把HealthFlux与普通疾病风险预测模型进一步区分开来。
普通预测模型主要回答的是:这个人未来会不会患某种疾病?而健康世界模型最终希望进一步回答:如果改变这个人的状态,未来会发生什么?
应可钧认为,如果模型能够做到这一点,就可能进一步用于模拟临床试验,甚至帮助寻找新的药物用途。但目前,这仍然是模型模拟,而不是真正的临床试验。
这项研究还特别强调,这些结果首先是模型产生的预测和研究假设,不能被解释为患者层面的因果治疗效应,更不能据此证明某一种药能够预防相应疾病。
此外,模型本身也还有改进空间。首先是数据。目前,HealthFlux已经整合大量不同模态,但应可钧认为,可穿戴设备、连续血糖监测等更加高频的纵向数据仍然非常关键。
与几个月甚至几年一次的体检和医学影像相比,这些设备能够以天甚至更短的时间尺度持续记录身体变化,而HealthFlux的连续时间架构,正好允许模型在新数据进来时随时更新健康状态。团队已经在把心率、睡眠、活动量等日常健康数据接入模型。
难点在于,拥有这类数据的队列随访时间通常较短,很难直接和多年后的健康结局对应起来。因此,团队正在探索迁移学习:以HealthFlux已经学到的长期健康变化为基础,再用可穿戴队列的原始数据微调或继续训练模型。
不同模态的编码方式同样还存在优化空间。在当前模型中,各种数据先经过自己的编码器,再被融合进统一的健康状态,但这一过程仍可能损失信息。
模型的泛化也并非没有边界。论文数据显示,在跨性别、年龄和BMI(身体质量指数)人群进行测试时,最高年龄组和最高BMI组的预测表现会有所下降。因此,HealthFlux目前更像是一次关于“如何建模人的健康”的探索,而不是已经可以直接进入临床的诊断系统。
但它背后还有一个更基础的问题:如果一个模型能够越来越准确地预测健康,是否意味着它开始“理解”健康?
应可钧将它类比为物理学中的方程。如果一个方程不仅能够解释已经观察到的现象,还能够准确预测新的物理现象,并得到实验验证,那么至少在被证伪之前,人们会认为它捕捉到了这个系统的一部分规律。
类似的问题也存在于虚拟细胞。如果一个模型能够准确预测各种干预之后细胞的下一个状态,它可能已经捕捉到了细胞运行的一些规律。
“当我们的模型能够极度准确地去预测健康疾病风险,能够极度准确地预测给药之后的变化,并且能够很好地泛化的时候,就代表模型可能某种程度上理解健康。”应可钧说。这也是他所说的下一个“AlphaFold时刻”。
尽管目前HealthFlux距离这个目标尚存在一定距离。但相比针对糖尿病、心血管疾病或者阿尔茨海默病分别训练一个模型,它至少提出了另一种思路:医学AI是否一定要从一种疾病出发?
或许,未来在预测一个人会得什么病之前,我们可以先尝试回答一个更基础的问题:这个人现在究竟处于怎样的健康状态,以及这个状态正在向哪里变化。
参考资料:
https://www.medrxiv.org/content/10.64898/2026.09.19.26363460v2
刘雅坤 | 文
内容来源:信睿科技评论
获取更多 AI时代的科技参考
欢迎点击下方卡片关注 信睿科技评论
热门跟贴