宏基因组测序虽然能揭示微生物群落的组成和功能,但现有计算方法很难将测序得到的海量碎片化序列准确拼接成完整的基因组,更难以同时分析微生物的遗传变异与宿主健康之间的关联。9月2日,西安交通大学杨铁林/郭燕团队在《自然·微生物学》上报道了他们开发的一套名为MetaCAT的计算框架,该框架不仅能够快速恢复高质量微生物基因组,还内置了从SNP检测到宿主性状关联分析的全套流程。
研究团队在MetaCAT的核心聚类模块中引入了一种稀疏加权狄利克雷过程高斯混合模型(SWDPGMM),这种模型把每条序列的k-mer频率和覆盖度信息作为输入,同时把序列长度作为权重因子纳入协方差估计,解决了传统方法忽略长度差异的问题。该团队还设计了基于单拷贝基因(SCG)的种子序列筛选策略,通过构建多个稀疏亲和图并利用半监督标签传播,先为种子序列分配初始聚类标签,再根据SCG评分模型挑选最优划分。对于样本量大或基因组数多的复杂数据集,SWDPGMM会先用高质量种子初始化各个组分的均值和协方差,然后仅对长序列(≥2 kb)进行初步拟合,收敛后再加载全部序列,这种分层计算策略大幅减少了迭代次数。对于简单数据集,模型则直接基于最优权重构建全序列亲和图,并把种子标签传播到所有节点上,两种路径都能保证聚类的准确性和稳定性。
为了验证MetaCAT的实际效能,团队在CAMI提供的九个模拟数据集上进行了系统测试,这些数据集涵盖了气道、海洋、皮肤、高复杂度环境等不同生态类型。在同等条件下,MetaCAT总共恢复了1,684个近完整基因组和1,979个高质量基因组,数量超过了COMEBin和Binny等当前主流工具。计算时间的对比更显出MetaCAT的优势,在CAMI气道数据集上,MetaCAT(GPU版)只用了8分43秒就完成了聚类,SemiBin2需要4小时20分,TaxVAMB用了4小时38分,COMEBin则耗时52小时34分,MetaCAT的峰值内存占用不到4 GB,而MetaDecoder超过了30 GB。团队随后又分析了103个来自IMG数据库的真实环境样本,MetaCAT从中得到8,993个高质量基因组,略高于COMEBin的8,980个,但MetaCAT完成全部计算仅用了不到10个小时,COMEBin在同一服务器上却运行了近三个月。
在结直肠癌(CRC)相关的应用分析中,团队收集了5个队列共计715份粪便宏基因组样本(含293例CRC患者和333例健康对照),用MetaCAT重建出21,836个高质量基因组,并经过物种层级去冗余最终确定1,631个代表性基因组,这些基因组的平均完整度为93.9%,污染率仅1.57%。基于这批代表基因组的丰度分析显示,CRC组和对照组的物种丰富度没有显著差异,但香农多样性指数在CRC组有小幅下降(P=0.0075),且整体群落结构发生明显分离(PERMANOVA检验P=0.000999)。差异检验共鉴定出135个细菌物种在两组间丰度不同,其中20个在CRC组富集,115个在CRC组耗竭,耗竭物种大多属于毛螺菌科和粪杆菌属(包括多个产丁酸的普拉梭菌亚种),富集物种则包括产毒素的大肠杆菌和脆弱拟杆菌等已知促癌菌。共发生网络分析显示,CRC组中富集的20个物种在CRC组内的节点度普遍高于对照组(符号检验P=1.91×10⁻⁶)。
进一步地,团队利用MetaCAT的SNP鉴定模块对715份样本进行基因分型。他们以logistic回归模型检验每个SNP与CRC状态的关系,同时校正物种丰度、年龄、性别、体质指数以及基于个体间SNP距离矩阵的前五个主成分,最终发现98个SNP达到Bonferroni校正的显著水平,这些SNP分布在6个细菌物种上,其中4个物种本身在丰度上并无组间差异。在独立验证队列(166人,含76例CRC和84例对照)中,97个可评估的SNP效应方向全部一致,并且91个SNP达到名义显著(P≤0.05)。功能注释发现其中11个SNP位于已知蛋白编码区内,包括两个非同义突变,一个位于共生梭菌的葡聚糖结合蛋白基因(P=9.39×10⁻¹⁰),另一个位于罗氏弧菌的IS110家族转座酶基因(P=6.18×10⁻¹¹),这些突变可能改变蛋白功能或转座活性,从而影响菌株在肠道环境中的适应能力。MetaCAT的源代码已公开在GitHub上,该工具为大规模微生物群落研究和宿主-微生物互作探索提供了一个高效且易用的解决方案。
READING
BioPeers
热门跟贴