美国加州大学圣迭戈分校团队把高通量DNA测序和机器学习放到一起,做了一件此前没人做成的事:大规模识别人类基因“起始子”的序列特征。他们先检测了约50万个“起始子序列的表达活性,再用这些数据训练模型,让模型自己找出“起始子”特有的DNA序列模式。

模型首次实现全基因组预测

打开网易新闻 查看精彩图片

训练完成后,研究团队让模型在人类基因组中搜索。结果显示,约60%的人类基因含有“起始子”元件。这意味着超过半数基因拥有这一核心启动元件,为理解基因表达启动机制提供了关键统计依据。此前,“起始子”是否存在、分布在哪些基因中,主要依赖零散实验判断;这次模型首次实现了对其存在与否的预测,并完成碱基模式解码。

可评估突变影响,也能设计合成启动子

这项工具的应用方向很具体。研究者表示,模型可用于预测“起始子”区域DNA突变的功能后果,帮助判断一个突变会不会影响基因启动。同时,它还能支持设计具有特定调控功能的合成启动子序列。也就是说,同一个模型既能做“解读”,也能做“生成”。

研究发表于《基因与发育》杂志。人类每个细胞中约含60亿个DNA碱基,里面藏着决定基因何时、何地、以多大程度表达的复杂“密码”。研究者强调,此次建立的“起始子”AI模型只是解析这一基因表达“密码”的一小部分,未来需要整合更多调控元件,才能向全面解析靠近。

研究定位仍是初步尝试

团队没有把话说满。按作者表述,当前模型仅覆盖调控密码的一小部分,后续方向是扩大模型范围,纳入更多调控元件。换句话说,这次成果更像是在基因表达调控的“密码本”上认出了其中一个高频字符,离完整读懂还有距离。