血浆中的游离DNA片段化特征作为癌症液体活检的标志物已受到广泛关注,但其背后的分子调控网络一直未能被清晰阐明。2026年7月18日,深圳湾实验室肿瘤研究所孙坤研究员和申雪桐研究员作为共同通讯作者,在《自然-通讯》上发表了题为“Epigenomic modifications define chromatin states to regulate cell-free DNA fragmentomics”的研究论文,该工作系统解析了表观修饰如何通过染色质状态影响cfDNA的断裂模式,并且基于转座子区域的片段化信息训练了高性能的泛癌种诊断和溯源模型。

打开网易新闻 查看精彩图片

研究团队分析了人类、小鼠和犬类血浆样本中cfDNA在16个高拷贝转座子家族中的分布情况,他们发现这些转座子内部的cfDNA片段长度、末端四核苷酸基序的使用频率以及相对于全基因组的覆盖深度均存在显著差异,而且不同转座子家族之间的这些特征也各不相同。由于同一家族的转座子拷贝在DNA序列上高度相似,研究团队便将这些转座子当作理想的天然实验平台,这样就能把DNA序列本身的变异对片段化的影响降到最低。他们进一步按照DNA甲基化水平把每个转座子家族的拷贝分为低甲基化、部分甲基化和高甲基化三组,结果低甲基化拷贝中短片段cfDNA的占比明显上升并且相对测序深度大幅下降,而部分甲基化拷贝的片段化特征并不处于高低两组之间的中间位置,这个现象说明除了DNA甲基化之外还有其他调控因素在起作用。

为了寻找那些额外的调控因子,研究团队利用cfChIP-seq技术检测了六种核心组蛋白修饰在cfDNA上的结合信号,并且将每个转座子家族的拷贝按照每种修饰信号的强弱划分为高信号组和低信号组进行比较。活性染色质相关修饰(如H3K27ac、H3K4me1和H3K4me3)信号较低的拷贝表现出短片段cfDNA比例的下降,而抑制性修饰(如H3K27me3和H3K9me3)信号较低的拷贝则出现了短片段比例的上升,两者的方向正好相反。研究团队还整合了这六种组蛋白修饰的数据将全基因组分割成15个不同的染色质状态,他们发现活跃启动子、增强子和转录延伸区域的cfDNA片段普遍更短且覆盖深度更低,而异染色质和多梳抑制区域的片段则更长、深度也更高。为了验证这些关联的因果关系,他们利用shRNA技术在培养细胞中分别敲低了负责H3K27me3和H3K36me3的写入酶EZH2和SETD2,结果两种修饰水平的改变确实引起了培养上清中cfDNA片段大小分布的相应变化,这直接证实了组蛋白修饰对cfDNA断裂的调控作用。

打开网易新闻 查看精彩图片

在肝细胞癌患者的血浆样本中,研究团队观察到多个转座子家族内部的cfDNA片段化特征发生了显著改变,其中相对测序深度在12个转座子家族中都能有效区分患者和健康对照,受试者工作特征曲线的曲线下面积从0.65到0.91不等。在两个覆盖了七种以上癌症类型的大规模公共数据集(包含超过1600例样本)中,转座子区域的片段化特征同样展现出了优秀的诊断潜力,并且不同癌症类型之间的改变模式存在明显差异,比如某些转座子在肝癌中升高而在肺癌中却降低,这种特异性为肿瘤组织来源的推断提供了线索。基于这些发现,研究团队构建了名为TEANA-Dx的梯度提升决策树模型,该模型只用了来自16个转座子家族的80到96个片段化特征,在交叉验证中的总体AUC达到了0.95以上,各个癌种的AUC介于0.91和0.99之间,并且对I期和II期癌症样本的AUC也分别达到了0.92和0.96。在独立的测试集上该模型依然保持了0.93的总体AUC,其在95%特异性下的灵敏度为85.1%,这个表现优于以往基于全基因组特征构建的DELFI等模型。研究团队还训练了TEANA-Top模型用于预测肿瘤的组织起源,该模型在七种癌症类型中的总体准确率达到了56.7%,显著高于随机猜测的水平。这项工作不仅深化了人们对cfDNA片段化分子调控机制的认识,也为癌症早筛和多癌种溯源提供了一个高效且特征精简的计算分析框架。

READING

BioPeers