[{"title": "跨人群基因预测,样本越多反而越不准?","content": "
Google Research 一项新研究发现:在跨人群基因组预测中,迁移学习并非样本越多越有益。对于小规模的目标人群,从欧洲人群数据中迁移学习能显著提升预测效果;但当目标人群样本量增大后,这种迁移反而会降低预测准确性——尤其对具有人群特异性遗传结构的性状而言。
为什么跨人群预测会失效?
多基因风险评分(PRS)通过遗传变异来预测疾病风险,通常整合成百上千万个遗传变异的影响。但它在临床决策中的应用率一直不高,部分原因在于:历史上的全基因组关联研究(GWAS)绝大多数基于欧洲人群,一旦应用到非欧洲人群,准确性就会大幅下降。这种差异源于跨人群之间遗传结构、群体结构和变异等位基因频率的不同。
对大多数医疗系统来说,在数十万人中从头开展GWAS成本过高。因此,利用已有的欧洲中心GWAS进行迁移学习,再补充目标人群特有的GWAS数据,被视为一种潜在解决方案。
实验设计:两个大型生物库的对比
研究团队评估了八种临床性状的PRS表现,同时变化目标人群和欧洲人群的样本量。具体来说,他们测试了在英国生物库(UKB)中数十万欧洲个体中建立的PRS,能否迁移到日本生物库(BBJ)——一个深度表型队列。
选用的八种性状包括:体质指数(BMI)、收缩压、舒张压、红细胞计数、白细胞计数、高密度脂蛋白胆固醇(HDL)、低密度脂蛋白胆固醇(LDL)和血糖。在UKB中,这些性状的遗传力估计在0.07到0.28之间。
核心发现:样本量拐点
研究采用三种方法评估PRS的可迁移性,所有模型都在同一组BBJ留出样本上评估。结果显示:当目标人群样本量较小时,迁移学习带来的增益明显;但随着目标人群样本量增长,这种增益逐渐消失,甚至转为负效应——模型精度反而下降。
这一发现为跨人群基因组预测提供了实证指导:迁移学习的价值取决于目标人群的样本规模,并非一味堆数据就能提升效果。对于资源有限、样本量较小的非欧洲人群,迁移学习仍是可行路径;但对于已有较大样本的群体,可能需要重新考虑训练策略。
热门跟贴