自人类基因组计划启动以来,获取完整的人类核苷酸序列便始终是科研界的核心目标。初代参考基因组受限于早期克隆与测序技术,难以完整解析大片段重复序列、着丝粒和端粒等高复杂度区域,约15%的基因组因无法有效比对而被长期搁置,严重制约遗传研究的推进;此后,WGS虽大幅降低了测序成本,却依然受困于重复序列的干扰。2022年,T2T联盟发布CHM13单倍型完整基因组,填补了传统版本缺失的约8%序列,首次实现单套染色体的无缺口组装,是基因组组装领域一次标志性突破。但该样本源自特殊单倍体细胞系,仅保留单一亲本的遗传信息,无法反映人体内父源与母源两套染色体间的差异,在罕见病病因定位和肿瘤高危区段筛查等临床场景中仍显不足。

随着长读长测序技术、Hi-C染色质构象捕获分析与自动化组装算法的日益成熟,为技术升级创造了成熟条件。近日T2T联盟在CellCell Genomics期刊集中发表12篇系列论文,以通用标准样本HG002为对象,完成分相二倍体基因组端粒到端粒的完整组装,构建了迄今为止最完整、最高质量的人类基因组序列。此次组装新增了此前参考基因组中缺失的15.3%基因组序列,包括701.4 Mb的常染色体序列和216.8Mb的性染色体序列,99.4%基因组达到近乎完美的组装准确性(即未检测到错误)。同时,研究完成二倍体水平的全面注释,覆盖两套单倍型内全部蛋白编码基因、转座元件、大片段重复序列与卫星重复序列,共注释得到39,144个蛋白编码基因。除人类基因组外,T2T联盟还同步发布了猕猴、狨猴、斑胸草雀、小鼠、马、驴和长颈鹿等8种脊椎动物的无缺口、高质量基因组数据,为基础研究、临床诊疗、物种进化研究等多个领域提供基础,成为基因组组装领域全新里程碑。

打开网易新闻 查看精彩图片

研究围绕基准样本HG002开展完整T2T基因组组装优化研究,该样本是多机构通用测序测试材料。研究团队利用170× PacBio HiFi、209× ONT 超长reads,亲本Illumina reads、Strand-seq和Hi-C数据,通过Verkko进行初始组装;并通过荧光原位杂交、专用工具处理难组装的rDNA区域;推出初代组装版本后开展三轮精细化迭代打磨,最终得到T2T-HG002v1.1。质量评估显示,组装QVQ68.9(31-mer若以21-mer计算则为Q76.2),错误率降至每800万碱基1个错误,显著优于以往HG002组装版本99.35%的二倍体基因组区域无检错误0.65%的区域(38.8 Mb)为低置信度区域,以rDNA序列阵列为主,其余为卫星重复和节段性重复区;排除rDNA后高置信度覆盖达到99.9%。

与GIAB v4.2.1基准相比,T2T-HG002新增701.4 Mb(11.7%)高置信常染色体序列多为卫星和节段重复等此前完全缺失的区域,以及216.8Mb性染色体序列;二者重叠区间内仅219处序列差异,但经检查多为参考偏差或难比对区域所致。

打开网易新闻 查看精彩图片

图1. T2T-HG002完整二倍体基因组

研究团队通过Liftoff、LiftOn多款注释工具,基于T2T-CHM13参考完成HG002父母源两套单倍型的基因注释。结果显示,剔除线粒体、免疫球蛋白基因后,母源单倍型(MAT,含X染色体)注释59,323个基因,父本源单倍型(PAT,Y染色体)共注释57,741个基因。与CHM13相比,HG002注释基因总数更多60,017个39个基因在两套单倍型中缺失,其中3个缺失的蛋白编码基因(HLA-DRB5、CT45A8、OPN1MW)均为已知天然拷贝数变异基因。基于MANE转录本,研究团队定义了“断裂基因”(即存在起始/终止密码子异常、提前终止密码子或蛋白相似度低于80%),共鉴定出MAT129个、PAT121个断裂基因,这些基因显著富集于节段性重复区域

研究团队共鉴定出25个单倍型特有、拷贝数存在差异的常染色体基因,其中13个MAT特有,包括 DUSP22、CFHR1/CFHR3、GSTT1、GSTM1等已知影响疾病易感性的拷贝数变异基因。此外,57个基因在MAT中拷贝数更高,39个在PAT中更高,展示了单倍型解析在结构变异区域的重要价值。

现有二倍体基因组从头组装、短读段推断组装普遍存在结构与碱基类错误,传统质控工具难以适配二倍体基准评估场景。为此,研究团队开发了GQC软件,其采用单倍型感知的比对策略,依托特异k-mers与隐马尔可夫模型划分分型区块,可区分碱基误差、分型错误,支持分区统计。研究以T2T-HG002为基准,对比评估了五年间5套主流HG002组装版本(Ash1v2、Hifiasm、HPRCv1、Verkko、ONT LC24)。结果显示,组装质量随时间显著提升,可比对序列中的替换错误率下降逾百倍,插入缺失率下降约十倍,结构连续性和相位一致性也持续改善,但长同聚物区域仍是组装难点。与经典k-mer工具Merqury相比,GQC提供更全面的评估

打开网易新闻 查看精彩图片

图2. 5个组装体与HG002比较

变异检测数据集应用广泛但难以覆盖全基因组,变异结果可回补参考序列构建变异衍生基因组。研究团队以GRCh38、T2T-CHM13为参考构建多组HG002变异衍生基因组开展评估。结果显示,基于GRCh38的变异集仅覆盖92.9%–93.8%HG002基因组,T2T-CHM13可提升至95.7%-97.8%;但即便采用完整参考,变异衍生基因组平均QV仅35-41,而最优从头组装QV可达51,覆盖度达99.94%。数据证实,全基因组从头组装在覆盖完整度与碱基准确度上,均比传统变异检测流程高出一个数量级。此外,完整基因组基准还可用于改进变异基准,T2T-HG002组装成果完善了GIAB变异基准,首次实现对复杂结构变异、重复区段变异的可靠评估

打开网易新闻 查看精彩图片

图3. 变异与基因组基准测试结果的比较

总之,此次发布的T2T-HG002v1.1是目前覆盖度、准确度最高的人类基因组基准,首次实现了对全基因组(除rDNA阵列外)的准确评估。该基准不仅为从头组装、变异检测、读段比对等各类分析方法提供了统一标尺,更关键的是,它推动了测序科学从“变异检测”向“基因组推断”的范式转变。

打开网易新闻 查看精彩图片

研究概要

01

02

03

04

05

打开网易新闻 查看精彩图片

快点亮"在看”吧!