近日,清华大学深圳国际研究生院刘晓团队联合江南大学等团队在人工智能与计算免疫学交叉研究领域取得新进展。
2026年9月24日,相关研究成果以“UpTCR: a unified progressive knowledge transfer foundation model for robust T-cell receptor-antigen binding recognition”为题,在线发表于国际学术期刊Nature Communications(《自然·通讯》)。论文提出统一渐进式知识迁移基础模型UpTCR,通过充分利用不同完整程度的TCR-抗原-HLA相互作用数据,实现对T细胞受体抗原识别的准确、泛化和可解释预测。
UpTCR不仅能够预测TCR与抗原-HLA复合物的结合特异性,还进一步拓展至抗原-HLA结合亲和力预测、TCR交叉反应分析、残基级相互作用解析以及肿瘤免疫场景下的迁移应用。研究团队还通过乳腺癌患者来源数据和黑色素瘤抗原变体的前瞻性细胞实验,对模型的实际应用潜力进行了验证。
从“不完整数据”出发,让AI学习T细胞的识别规律
T细胞是人体适应性免疫系统的重要组成部分。
在免疫识别过程中,细胞内产生的抗原肽首先由人类白细胞抗原(HLA)分子呈递,随后被T细胞表面的T细胞受体(T-cell receptor,TCR)识别。
这一看似简单的“分子识别”,实际上决定了T细胞能否准确识别病毒感染细胞、肿瘤细胞等异常目标,也构成了肿瘤疫苗和TCR工程化细胞治疗等免疫疗法的重要基础。
然而,要利用人工智能准确预测这一过程并不容易。
一方面,完整获得TCRα、TCRβ、抗原和HLA四个组分的实验数据成本较高、技术复杂,目前高质量完整数据仍相对有限;另一方面,一个TCR还可能识别多个不同抗原,即存在复杂的TCR交叉反应(cross-reactivity)。这种特性既拓展了免疫系统的识别范围,也可能给T细胞治疗带来潜在脱靶风险。
如何让人工智能在数据并不完整的现实条件下,真正学习T细胞识别抗原的规律?
围绕这一问题,研究团队提出了UpTCR。
从二元到三元再到四元:建立渐进式知识迁移框架
UpTCR的一个核心思想是:不要求模型一开始就拥有完整的四组分数据,而是让它从简单关系中逐步学习复杂的免疫识别规律。
研究团队设计了两阶段渐进式预训练策略。第一阶段,模型利用TCRα-抗原、TCRβ-抗原、抗原-HLA等大量二元相互作用数据进行预训练;第二阶段,进一步利用TCRα-TCRβ-抗原、TCRα-抗原-HLA、TCRβ-抗原-HLA等三元数据学习更高阶的分子关系;最终,这些知识被迁移到完整的TCRα-TCRβ-抗原-HLA四组分识别任务中。这有些类似于学习一门复杂语言:先理解“词”,再学习“短语”,最终理解完整“句子”。
与此同时,UpTCR并非只关注传统模型经常使用的TCR CDR3区域,而是综合利用全长TCR可变区、CDR3关键基序以及蛋白质语言模型提供的结构与进化信息,构建多尺度分子表示。
图注:UpTCR通过二元和三元数据进行两阶段渐进式软对比预训练,并迁移至TCR结合特异性、结合亲和力、交叉反应及肿瘤免疫等下游任务。
引入“软对比学习”,应对TCR复杂的交叉反应
传统对比学习往往将已经确认配对的分子视为正样本,把其他随机组合全部视为负样本。
但这种简单的“0或1”逻辑并不完全符合真实的免疫系统。
因为对于具有交叉反应能力的TCR而言,一个暂未被实验确认的TCR-抗原组合,并不意味着它一定无法发生结合。
为此,研究团队在UpTCR中提出了软对比学习策略,利用分子内部的相似性信息“软化”传统硬标签,使模型能够学习更加连续、更接近真实生物物理规律的结合关系,从而降低潜在假阴性带来的影响。
对于抗原-HLA关系,研究团队进一步提出SoftTri方法,将实验测得的IC50结合亲和力引入训练过程,使模型不再简单地将抗原-HLA关系划分为“结合”和“不结合”,而是学习结合强弱的连续变化。
这一设计,使UpTCR能够更好地处理真实免疫系统中的复杂性。
面对已知、少样本甚至未知抗原,UpTCR保持稳定预测能力
研究团队在多种难度逐步增加的场景下评估UpTCR,包括常规数据场景、少样本(few-shot)场景,以及抗原从未在训练集中出现过的零样本(zero-shot)场景。
在常规场景中,UpTCR在TCR-抗原-HLA结合特异性预测任务上取得0.905的AUC和0.749的AUPR;
在少样本场景中,AUC达到0.800;
即使进一步进入严格的零样本场景,模型依然表现出对未知抗原的泛化能力。
这意味着,相较于仅在大量已知数据上学习已有规律,UpTCR更希望解决一个实际应用中更加重要的问题:面对没有见过、或者只有极少实验数据的新抗原,模型还能不能进行有效预测?
图注:UpTCR在常规、少样本及不同严格程度的零样本测试场景中进行TCR-抗原-HLA结合特异性预测。
不仅判断“能不能结合”,还尝试回答“在哪里结合”
对于生物医学人工智能而言,只有一个预测分数往往是不够的。研究人员还希望进一步知道:
模型为什么认为二者能够结合?哪些氨基酸残基真正参与了识别?
因此,UpTCR进一步构建了相互作用构象预测模块,对TCRα、TCRβ、抗原和HLA四种分子之间的全部六种两两关系进行残基级空间距离预测,包括:TCRα-TCRβ、TCRα-抗原、TCRβ-抗原、TCRα-HLA、TCRβ-HLA以及抗原-HLA。
研究团队利用164个实验解析的TCR-抗原-HLA复合物晶体结构进行训练与验证,并进一步加入1037个经过严格质量筛选的AlphaFold预测复合物,以增强结构学习能力。
在独立的39个TCR-抗原-HLA复合物结构测试集中,模型进一步验证了对未知结构的泛化能力。
从而,UpTCR不只是回答:“它们能不能结合?”还进一步尝试回答:“它们可能通过哪些残基发生作用?”
图注:UpTCR可以对TCRα、TCRβ、抗原和HLA之间六类两两残基接触关系进行预测,并与真实结构进行比较。
从公共数据库走向真实乳腺癌患者样本
一个计算模型是否具有真正的转化潜力,仅依靠公共数据集上的指标还远远不够。
因此,研究团队进一步将UpTCR应用于真实乳腺癌患者来源的数据。研究纳入Luminal型和三阴性乳腺癌(TNBC)患者,通过32种乳腺癌相关肿瘤抗原肽刺激患者外周血单个核细胞,并结合TCR测序建立乳腺癌抗原特异性TCR数据集。最终,研究获得了Luminal亚型709组高置信度阳性TCR-抗原对以及TNBC亚型489组高置信度阳性TCR-抗原对。 在仅使用10%至40%迁移数据的情况下,研究进一步评估UpTCR对患者来源新TCR-抗原关系的预测能力。结果表明,在Luminal和TNBC两种乳腺癌亚型中,UpTCR均表现出良好的少样本迁移能力,显示出其在患者特异性实验数据较为稀缺场景下的应用潜力。
图注:研究利用Luminal型和三阴性乳腺癌患者样本构建抗原特异性TCR数据,并评价UpTCR在不同迁移数据量下的预测表现。
从约11万个候选抗原中预测,再交给细胞实验验证
为了进一步验证模型能否真正辅助新的抗原发现,研究团队开展了前瞻性计算预测与湿实验验证
研究以经典黑色素瘤相关抗原Melan-A/MART-1为对象,从天然抗原肽EAAGIGILTV出发,通过氨基酸替换、插入和删除等方式,构建了约11万个候选抗原变体。
随后,研究团队利用UpTCR对这些抗原逐一预测并排序,从中选择了8个预测高结合抗原变体AHV1-AHV8以及1个预测低结合变体AntigenLV进行后续细胞实验验证。更具挑战性的是,其中部分预测高结合抗原与原始Melan-A抗原的序列一致性仅为40%—54.5%。研究人员随后构建表达相应TCR的CD8⁺ Jurkat细胞,并通过检测IL-2分泌以及早期T细胞激活标志物CD69评价不同抗原的免疫激活能力。实验结果与模型预测总体一致:预测为高结合的AHV1-AHV8均能够诱导更明显的T细胞激活,而预测低结合抗原、无关肽和DMSO对照所诱导的激活较低。
这一过程实现了从:大规模计算生成--AI预测筛选--候选抗原合成--细胞功能实验验证的完整闭环。
图注:UpTCR从大规模Melan-A/MART-1抗原变体中筛选候选肽,并利用IL-2和CD69实验对T细胞激活能力进行验证。
研究由清华大学深圳国际研究生院、江南大学人工智能与计算机学院、澳门大学健康科学学院癌症中心与转化医学研究院、腾讯AI for Life Sciences Lab等单位共同完成。姚建华、苗凯、刘晓、潘翔为本文的共同通讯作者。吕天旭,肖阳,陈立,何冰,钟脉艺为共同第一作者。
01|
02|
03|
04|
快点亮"在看”吧!
热门跟贴