复杂表型的遗传相关性通常在全基因组尺度进行定义和估计。然而,越来越多的研究发现,不同基因组区域可能对同一对表型产生方向不定且大小不一的遗传作用,仅依赖表型之间整体的遗传相关性分析,往往无法准确描述表型之间的遗传关系。

近年来,基因组局部遗传相关性分析工具LAVA【1】等方法相继提出,尝试在基因组较小的区段范围内分析表型之间共同的遗传基础。然而,以LAVA为代表的方法存在问题和局限:首先,其敏感度过高,容易产生大量假阳性结果;其次,因采用矩估计(Method of Moments)方法,其统计学功效受限;再次,其基于模拟抽样进行统计推断,对计算资源消耗较大,不适合在大规模表型组分析中广泛应用。

2025年3月10日,复旦大学沈侠团队在Nature Genetics杂志上发表了题为An enhanced framework for local genetic correlation analysis的论文。该研究开发了分析基因组局部遗传相关性的“局部高精度似然函数”方法(HDL-L;High-Definition Likelihood for Local),将用于分析全基因组水平遗传参数的高精度似然函数模型【2】(High-Definition Likelihood, HDL)扩展到基因组局部区段的分析中,显著提高了局部遗传相关参数估计的精准度和可靠性。

更精细的局部遗传相关性估计

遗传相关性反映的是全基因组DNA变异在两个或多个性状上的协同作用机制。这种“协同作用”在基因组各区域并不总是呈现一致的方向——某些基因组区域可能对两种表型产生相同方向的影响,另一些区域则可能表现方向不一致的调控。传统的全基因组遗传相关性估计只能得到一个单一的相关系数,往往忽视了这类基因组局部差异的存在,使许多细节“湮没”在整体结果之中。

此次发布的HDL-L方法在分析中,可以将基因组划分为多个相互之间相对独立的区块,并利用极大似然估计(Maximum Likelihood Estimation)实现对每个区块内遗传率(Heritability)和遗传协方差(Genetic Covariance)的准确评估。模拟研究表明,较之于当前主流的LAVA方法,HDL-L在两大方面表现突出:

1.估计精度显著提升:在估计每个区块的遗传率与遗传协方差时,HDL-L不仅系统偏差更低,且总体均方误差(Mean Squared Error)减少幅度可达数倍,使得对局部遗传相关性估计的标准误(Standard Error)更小,能更好地反映两个表型在基因组不同区段内的共同遗传结构。

2.大幅降低假阳性率:研究发现,LAVA在统计推断方面存在明显偏差,容易报告实际并不存在的遗传相关性信号。HDL-L基于全似然函数(Full Likelihood)进行统计推断,并结合似然比检验(Likelihood Ratio Test)计算p值与置信区间,在确保统计功效的同时,更有效地抑制假阳性结果。

此外,HDL-L还展现出了出色的计算效率。在涉及数百万位点的全基因组关联概括统计量(Genome-Wide Association Summary Statistics)数据上,对全基因组2000多个区段进行估计时,其整体运算时间约为LAVA的1/15,为今后大规模表型组研究提供了基础。

在真实数据中的应用

研究团队采用UK Biobank中的30个性状(包括行为、疾病风险与人体测量指标等),分别运用HDL-L和LAVA进行局部遗传相关分析。结果显示,HDL-L共鉴定出了109个显著的局部遗传相关信号,而LAVA给出了更多但可疑性较高的结果。通过与遗传共定位(Colocalization)工具COLOC【3】比较可以发现,HDL-L的显著结果与遗传共定位检验结果更具一致性,更加合理,可信度更高。

为表型组的遗传学研究开拓新路径

继LDSC【4】与HDL方法之后,HDL-L成为统计遗传领域另一个有效的分析方法。HDL-L不仅能帮助我们在分析全基因组整体遗传相关性的同时,进一步解析有哪些特定基因组区域在促进或抑制表型之间的遗传关联,也能为功能位点挖掘和基因调控网络研究提供更多有针对性的线索。

在生物医学研究中,局部遗传相关的发现可以为疾病与共病的分子机制提供更直接的指引。例如,若某一区段对两个疾病表型均有较强的正向影响,就提示该区域的基因变异对二者可能存在同方向的致病通路;而若某一区段表现出负向的遗传相关性,则可能意味着潜在靶点对两种疾病不同方向的作用机制。对于临床转化和精准医学而言,这些信息能帮助我们鉴定更为有效的治疗靶点或药物研发方向。

HDL-L方法可直接使用当前多种GWAS概括统计量资源,避免了对原始个体基因型数据的依赖,能方便地拓展到大规模、多表型的联合分析中,为更广泛的数量遗传学和群体遗传学研究提供了新的工具。HDL-L软件与示例已在GitHub上开源(https://github.com/zhenin/HDL),方便广大研究人员结合自己的数据进行使用。研究团队也表示,根据实际需要,软件工具在未来也会逐步积累更多基因组分区(基因水平、功能注释水平、TAD结构水平等)预先计算的连锁不平衡参考面板(Linkage Disequilibrium Reference Panels)供用户使用,并持续拓展和改进HDL系列算法的适用范围。

https://www.nature.com/articles/s41588-025-02123-3

参考文献:

1. Werme, J., van der Sluis, S., Posthuma, D. & de Leeuw, C. A. An integrated framework for local genetic correlation analysis. Nat. Genet.54, 274–282 (2022).

2. Ning, Z., Pawitan, Y. & Shen, X. High-definition likelihood inference of genetic correlations across human complex traits. Nat. Genet.52, 859–864 (2020).

3. Giambartolomei, C. et al. Bayesian Test for Colocalisation between Pairs of Genetic Association Studies Using Summary Statistics. PLOS Genet.10, e1004383 (2014).

4. Bulik-Sullivan, B. K. et al. LD Score regression distinguishes confounding from polygenicity in genome-wide association studies. Nat. Genet.47, 291–295 (2015).

学术合作组织

(*排名不分先后)


战略合作伙伴

(*排名不分先后)

(*排名不分先后)

转载须知


【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。

BioArt

Med

Plants

人才招聘

会议资讯

近期直播推荐