打开网易新闻 查看精彩图片

蛋白质与 DNA 之间的相互作用驱动众多细胞功能,例如基因表达调控、染色质重塑,以及 DNA 复制、修复和重组等过程。鉴定蛋白质中的 DNA 结合 位点 有助于 准确 识别 DNA 结合蛋白,并揭示其发挥细胞功能的分子机制。当前, X 射线晶体学、核磁共振波谱学和冷冻电子显微镜等实验技术 常 用于表征这类相互作用的结构特征,从而间接提供 氨基酸水平的 DNA 结合 注释信息。 目前, PDB 数据库中 仅 存储 约 9200 个蛋白质 -DNA 复合物结构,这意味着仅有少部分 DNA 结合蛋白拥有此类分子层面的详细数据。

基于 计算的研究方法能够提供高通量 蛋白质 -DNA 结合位点 的识别,并且能够直接标定蛋白质序列上的潜在 DNA 结合残基。 笼统地讲,这些方法可以分为基于有序构象蛋白质的方法和基于固有无序蛋白质的方法。 前者在模型的构建和优化过程中使用有序构象蛋白质 ‌ ,这类蛋白质具有唯一或少数几种稳定的三维结构,遵循 “ 序列决定结构,结构决定功能 ” 范式;后者在模型的构建和优化过程中使用固有无序蛋白质,这类蛋白质 往往 缺乏稳定疏水核心,呈现动态变化的构象系综,其功能表达依赖构象可塑性,常通过 “ 结合诱导折叠 ” 机制与不同配体发生相互作用。 ‌‌

研究者 归纳总结这两类注释之间的差异, 并且发现 相应预测方法在对另一类注释进行预测时表现相对较差的问题。基于结构的注释通常反映蛋白质表面结构化口袋内的结合情况;而基于无序区域 (IDRs) 的注释则表现为在配体未结合状态下结合口袋缺乏稳定的三级结构,其结合过程伴随诱导折叠,且同一段 IDR 可能因结合不同配体而呈现多种构象。值得注意的是,两种数据来源所提供的结合注释在性质上存在根本差异:基于结构的数据源标注的是 DNA 结合残基,即与 DNA 空间邻近并被认为直接相互作用的氨基酸;而基于 IDRs 的数据源标注的是 DNA 结合 IDRs ,即与 DNA 相互作用且由至少 10 个连续氨基酸组成的 IDRs 。

研究者 通过对相关 PubMed 文献及近期综述内容进行分析, 收集并整理 过去二十年间约 50 项研究 方法 , 这些研究方法 普遍 存在以下缺陷: ① 基于有序构象蛋白质设计的方法,无法 有效 运用在固有无序蛋白质上 , 基于固有无序蛋白质设计的方法,无法 有效 运用在有序构象蛋白质上 ; ② 基于固有无序蛋白质设计的方法,只能提供低分辨率 IDRs 水平 的识别,无法实现 高分辨率 残基水平 的预测 ; ③ 绝大多数方法在识别蛋白质 -DNA 结合位点的时候, 倾向于 笼统预测结合位点,无法特异性判定蛋白质 -DNA 结合位点。

近日, 信阳师范大学张健课题组和美国弗吉尼亚联邦大学Lukasz Kurgan教授 课题 组 在 Nucleic Acids Research 期刊 上发表了题为DNAreader: accurate prediction of DNA-binding residues in structured and disordered proteins using transformers and contrastive learning的 研究论文 。 该研究 提出了 DNAreader 预测方法, 是 能够同时针对有序构象与固有无序蛋白质中 DNA 结合位点进行特异性识别的工具 。

打开网易新闻 查看精彩图片

DNAreader 采用堆叠 Transformer 编码器网络,并融合 采样批次训练 与 多中心对比 学习策略, 实现残基水平的结合位点预测 。 独立测试集上的实验结果 表明, DNAreader 显著优于现有 研究 方法 。特别是, 该方法 能够同时在 有序构象与固有无序蛋白质上 实现准确预测 , 并且 具有极低的交叉预测错误率 。 本文 还 进一步 开发了 DNAreader DBIDR 模块,可准确预测 DNA 结合 IDRs ,既支持在 IDRs 内部识别 DBRs ,也支持预测完整的 DNA 结合 IDRs , 针对生物学家的现实需求 提供灵活的应用选择。 DNAreader 整体 架构如图 1 所示。

图 1 . DNAreader 方法 整体 架构图

打开网易新闻 查看精彩图片

图 2 . 不同方法在 DNA 结合蛋白质上的预测效果

图 2 展示 了 不同方法在 Human ERRβ protein ( 人类 ERRβ 蛋白, DNA 结合蛋白质,固有无序蛋白质 ) 上的预测效果 。如图所示, DNAreader 成功命中 DNA 结合域中的 DNA 结合位点 ; DNAreader DBIDR 则 成功命中 DNA 结合 IDR 。

打开网易新闻 查看精彩图片

图 3 . 不同方法在非 DNA 结合蛋白质上的预测效果

图 3 展示 了 不同方法在 L-lactate 2-monooxygenase protein (L- 乳酸 2- 单加氧酶蛋白,非 DNA 结合蛋白质,有序构象蛋白质 ) 上的预测效果 。如图所示, DNAreader 成功规避了绝大多数其它类型结合位点 , DNAreader-DBIDR 成功规避了所有的交叉预测错误 。

DNAreader 在线预测网站: http://biomine.cs.vcu.edu/servers/DNAreader/

DNAreader 数据与源代码: https://github.com/jianzhang-xynu/DNAreader

河北工业大学人工智能学院钱静静博士 和 印度 比尔拉理工学院 Sushmita Basu 副教授 为 论文合作者。

原文链接:https://academic.oup.com/nar/article/54/15/gkag779/8760019

制版人:十一

参考文献

1. Zhang, J., Basu, S., Qian, J., & Kurgan, L. DNAreader: accurate prediction of DNA-binding residues in structured and disordered proteins using transformers and contrastive learning.Nucleic Acids Research, 2026, 54(15), gkag779.

2. Zhang, J., Basu, S. and Kurgan, L., HybridDBRpred: improved sequence-based prediction of DNA-binding amino acids using annotations from structured complexes and disordered proteins.Nucleic Acids Research, 2024, 52(2), e10-e10.

学术合作组织

(*排名不分先后)

打开网易新闻 查看精彩图片

推荐直播

转载须知

【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。

BioArt

Med

Plants

人才招聘