DNA甲基化这种表观遗传修饰在基因表达调控、细胞分化以及基因组稳定性维持中发挥着关键作用,其异常模式与多种肿瘤、神经系统疾病和代谢综合征的发生发展密切相关。2026年8月18日,澳门理工大学应用科学学院魏乐义教授联合天津大学苏苒团队、中国科学院自动化研究所吴书团队,在《自然-通讯》上发表了题为“Decoding the sequence determinants of locus-specific DNA methylation across human tissues”的研究论文。三位通讯作者分别是Shu Wu、Ran Su和Leyi Wei研究员。该研究团队开发的Melody深度学习框架能够从长达10 kb的基因组DNA序列中精确预测39种人体组织的CpG位点甲基化水平,为理解甲基化修饰的序列编码规则提供了全新的计算工具。
现有甲基化预测模型大多采用几十个碱基对的短序列窗口,这种设计使得模型难以捕获远端调控元件对甲基化状态的影响。研究团队将输入序列扩展至10 kb,模型因此可以同时整合局部序列特征和远距离调控信号。Melody采用全卷积编码器-解码器结构,在主任务之外还设置了两个辅助预测分支,分别用于预测每100 bp窗口内的平均甲基化水平和CpG二核苷酸密度。这种多任务学习策略帮助网络在不同尺度上学习甲基化相关的序列特征。他们在一系列严格的评估条件下测试了模型性能,这些条件包括全染色体留出验证、低甲基化区域采样验证以及细胞类型特异性区域验证。在这几项测试中,Melody的平均Spearman相关系数比现有最佳方法高出约17%,并且在低甲基化区域这种其他模型容易失效的场景下,该模型依然维持了稳定的预测精度。
遗传变异如何影响DNA甲基化水平是功能基因组学研究中的一个重要问题。研究团队构建了一个涵盖三个独立队列的meQTL评估数据集,并在这个平台上比较了不同模型的变异效应预测能力。Melody-MT多通道版本在血液来源的甲基化缺失序列数据上取得了0.62的Pearson相关系数,在GTEx全血数据上也达到了0.42。他们发现多通道模型在meQTL预测任务上的表现优于单通道版本,后者虽然在细胞类型特异性区域预测上更为准确,但可能过度依赖于局部的细胞模式。多任务联合训练使得模型学到了更具普适性的调控序列语法,而这种语法特征对于解释遗传变异如何通过甲基化影响疾病风险具有重要价值。在跨距离窗口的测试中,Melody在所有距离尺度上的表现都优于其他模型,但随着变异与CpG位点之间距离的增加,所有模型的性能均出现了下降。
为了解析不同转录因子结合基序对甲基化水平的调控作用,他们对282个基序进行了系统的插入扰动实验,并计算了每个基序的效应强度和组织特异性两个量化指标。结果显示HD/10和NR/1这类基序同时具备高效应强度和高组织特异性,它们可能作为谱系限制性的调控因子发挥作用。在六种代表性组织的比较中,CTCF基序附近出现了典型的非平滑波动模式,这种模式与其作为甲基化敏感绝缘子的已知功能高度吻合。当按照染色质状态对基序效应进行分组比较时,启动子区域的效应变异幅度最大,而抑制型染色质区域同样表现出强烈的效应,这种特征与增强子区域明显不同,说明不同染色质环境下可能存在着根本性差异化的调控机制。
Melody-G作为框架中专为跨细胞类型泛化设计的变体,整合了基于单细胞RNA测序数据的细胞状态嵌入。该模型先在全染色体水平进行初步训练,再在细胞类型特异性区域进行精细化调优。在五个未参与训练的细胞类型上,Melody-G的平均AUC达到0.697,比单纯依赖已知细胞类型平均甲基化信号的基线方法高出10%以上。通过计算基因扰动对预测结果的影响分数,他们发现敲除CTSL和CSF1等基因会显著改变胰腺δ细胞的甲基化预测值,这些基因正好富集在类风湿性关节炎相关的KEGG通路中。转录组特征能够有效编码细胞的功能状态,而这种编码方式为模型的泛化能力提供了可解释的基础。
READING
BioPeers
热门跟贴