html
抑郁症是一种特别常见的心理疾病,影响着全球数百万人。医生们已经搞清楚了,这病是身体底子和外界压力一起闹出来的。最近发表在《美国国家科学院院刊》上的一项研究,用机器学习的方法,把几千个小时候受创伤让抑郁基因风险变大的例子给画了出来。他们发现,小时候受的伤对基因的敏感度影响特别大,这背后有生物学上的联系,以前那些老统计方法根本看不出来。
科学家们知道,人跟人DNA不一样,但这不能完全决定谁会得重度抑郁症。你可能带着某些容易得抑郁的基因,但要是没碰上特别大的压力,可能一辈子都不会犯病。这通常叫基因和环境的相互作用。研究人员一直在找这些相互作用,因为抑郁的基因风险分散在人类基因组的好几百个地方。
科学家想找这些相互作用时,一般会用全基因组交互研究。这法子一次只测一个基因变异和一个环境因素,看它们是不是一起影响某种病。可惜的是,这种一对一的搞法,统计上劲儿不够,没法在这么多基因数据里找出那些分散的、不容易看出来的非线性规律。测试太多,统计上全是杂音,把真结果都给盖住了。
耶鲁大学公共卫生学院的生物统计学家Yue Hua带着一个团队,想绕开老方法的那些毛病。Hua跟另外两个作者Jeffrey R. Gruen和Heping Zhang,决定用先进的机器学习技术来分析一大堆数据。他们觉得,算法看数据比那些标准线性方程要全面得多。
研究人员求助于英国生物银行(UK Biobank),这是一个收录了英国志愿者遗传和健康信息的大型数据库。他们先筛选数据,确保信息完整、病例匹配,然后建立了一个包含38,018名参与者的研究组。其中一半人曾被诊断为抑郁症,另一半人作为对照组,没有报告任何精神疾病。
为了评估环境压力,研究团队使用了参与者关于过去创伤经历的问卷回答。他们将这些经历分为三个不同的类别,包括童年创伤、成年创伤和灾难性创伤。
遗传数据包含超过285,000个单核苷酸多态性。单核苷酸多态性是一种微小的自然变异,只改变一个人DNA序列中的一个字母。为了找出这些遗传变异和创伤报告之间的关联,研究团队使用了一种称为随机森林的算法。
随机森林模型的做法是,用数据的随机子集构建几百棵独立的决策树。每棵树根据遗传变异和创伤类型对数据进行分割,试图预测一个人是否患有抑郁症。如果某个遗传变异和某种创伤类型在这些决策路径上总是挨在一起,算法就会把它们标记为一对交互组合。
当研究人员对数据进行传统的全基因组交互研究时,结果不出所料地平淡无奇。他们没有发现任何变异达到统计学显著性的阈值,所有结果均不显著。这一结果与此前研究一致,那些研究也未能找到可靠的遗传交互信号。
应用随机森林方法则产生了截然不同的结果。该算法识别出8,225对特定组合,其中遗传变异与创伤暴露似乎共同作用,增加了抑郁风险。这些变异对应到人类基因组中的1,732个独特基因。
当按创伤类别对结果进行分类时,早期生活逆境最为突出。童年创伤在发现的遗传交互中占比最大。这表明,在早期发育阶段经历的创伤在触发遗传脆弱性方面作用特别大。
为了在数学上验证这一模式,研究团队计算了研究中不同亚组的抑郁遗传力。遗传力是一个统计指标,用来估算在特定人群中,某个特征受遗传因素影响的程度,而不是环境因素。
对于那些报告称自己经历过童年创伤的人来说,抑郁症的遗传率估计值达到了13.3%。相比之下,那些没经历过童年创伤的人,遗传率估计值就降到了6.0%。这个差异从数学上说明,要是早期生活里有压力,遗传因素对抑郁症的影响就会大得多。
跟没受过创伤的人比,成年期创伤和灾难性创伤也显示出遗传率稍微高一点的模式。不过,其他创伤类别的差异在统计上就不算明显了。
接下来,研究人员盯上了22个关键基因,这些基因在机器学习模型里跟创伤的交互次数最多。翻了一遍现有的医学文献,发现这些基因几乎全都跟之前已知的精神或神经疾病有关系。其中一些被点名的基因,跟双相情感障碍、记忆功能和睡眠问题都有关系。
为了确认算法检测到的确实是真实的生物现象,团队换了一拨完全不同的人来验证他们的主要发现。他们用了“青少年大脑认知发展研究”的数据,这项研究一直在跟踪美国儿童的健康和成长情况。因为参与者都是九岁、十岁的小孩,研究人员就专门去验证童年创伤的交互作用。
通过在这个独立队列上开展专门的遗传分析,研究人员重现了22个顶级基因中13个基因的交互信号。在一组独立的美国儿童中发现相似的生物学模式,为最初在选择性较年长成人队列中检测到的模式提供了二次验证。
尽管这些发现为抑郁症提供了更广阔的新视角,但研究人员也指出了其方法上的若干局限性。在初始数据筛选阶段,数十万名参与者因未回答创伤调查问卷中的问题而被排除在外。这种大规模排除大大减少了样本量,并可能给研究人群引入未知的偏倚。
另一个局限性在于随机森林算法本身的机制。决策树结构本身就偏向于那些对结果有很强独立影响的变量。因此,该算法有时可能会把某个基因和某种创伤类型误判为交互配对,而实际上它们只是对抑郁症具有非常强且完全独立的影响。
未来的研究需要厘清这些算法上的模糊之处。研究人员希望把这些机器学习发现当作筛选工具,随后通过生物实验室测试来验证基因在压力下究竟如何发挥作用。弄清具体的细胞机制,最终可能为治疗压力相关的精神疾病开辟新路子。
热门跟贴