打开网易新闻 查看精彩图片

如果把一个人的血液指标、DNA 甲基化数据、基因表达和血浆蛋白数据直接交给大模型,它能不能判断这个人有多大、未来死亡风险如何?如果把一个基因的实验数据给它,它又能不能判断这个基因究竟会促进还是延缓衰老?

过去几年,大模型越来越多地进入生命科学研究,但它们最擅长的事情,仍然是处理已经被写成人类语言的知识:读论文、查资料、总结文献,再根据已有信息提出假设。模型能够回答衰老有哪些标志,并不代表它看到几万个基因表达值、数百个 DNA 甲基化位点或者一组血液生化指标时,也能理解这些数据意味着什么。

9 月 17 日,Insilico Medicine、Liquid AI、巴克衰老研究所、哈佛医学院和布莱根妇女医院等机构的研究人员在 Cell 发表论文,推出了一套面向衰老研究的大模型体系,包括用于测试模型能力的 LongevityBench、专门针对衰老数据训练的 Longevity-LLMs,以及把大模型与各种衰老分析工具连接起来的科研智能体 Longevity Claw。

研究团队希望通过这套体系,测试大语言模型处理衰老相关生物数据的能力,并探索 AI 在衰老研究中的应用方式。

直接把真实生物数据交给模型

研究团队首先开发了 LongevityBench,用于系统评估大语言模型在衰老生物学任务中的表现。

过去,大模型在生命科学领域的测试,很多集中在知识问答,例如询问某个基因的功能、某种疾病涉及哪些通路。这类任务更接近检验模型是否读过相关资料。

而 LongevityBench 采用了不同方式:研究人员直接将真实世界的生物数据输入模型,让模型根据这些数据完成预测。该 benchmark 包含 17 类任务、25,457 个测试提示词,覆盖临床指标、DNA 甲基化、转录组、蛋白质组和遗传学五个方向的数据。

其中,临床任务主要考察模型是否能够根据基础健康指标推断年龄或健康风险。例如,模型需要根据血液检测指标、身体测量数据等信息,比较不同样本的年龄差异,或者预测未来 10 年死亡风险。

在 DNA 甲基化任务中,模型需要处理表观遗传数据。DNA 甲基化是目前研究最广泛的衰老指标之一,随着年龄增长,人体大量 CpG 位点的甲基化水平会发生规律性变化。研究人员将这些位点信息输入模型,让模型判断样本年龄。

转录组任务中,模型需要分析不同年龄阶段基因表达模式的变化;在蛋白质组任务中,则需要根据血液中大量蛋白质水平的变化预测年龄;遗传学任务则要求模型结合基因扰动实验和已有数据库信息,判断某些基因变化与衰老之间的关系。

这些数据来自多个公开资源,包括美国国家健康与营养调查(NHANES)、基因表达数据库(GEO)、GTEx 项目、Olink 蛋白质组研究,以及 OpenGenes、CellAge、SynergyAge 等衰老相关数据库。

为了保证测试结果可靠,研究团队对数据划分进行了专门设计,避免模型直接接触测试答案。例如,部分数据按照研究项目、个体或蛋白家族进行拆分,让模型面对未见过的数据完成预测。此外,研究人员还通过改变问题表达方式、调整数据排列顺序等方法,测试模型是否只是依赖固定模板回答,而不是根据输入数据进行判断。

在完成 benchmark 后,研究团队测试了多款通用大语言模型,包括来自 OpenAI、Google、Anthropic、xAI、DeepSeek、Moonshot AI 等公司的模型。

结果显示,不同通用模型在不同任务上的表现差异明显。有些模型在临床指标预测中表现较好,但在 DNA 甲基化或蛋白质组任务中表现下降,没有一个通用模型能够覆盖所有类型的衰老数据。

尤其是在直接从多组学数据预测年龄时,通用大模型的表现并不稳定。基于这一结果,研究团队进一步尝试:如果不继续扩大模型规模,而是针对衰老数据进行专门训练,能不能获得更好的效果?

最大只有 9B,综合排名却超过 Gemini 和 Claude

因此,他们基于 Liquid AI 的 LFM2,以及阿里巴巴 Qwen3、Qwen3.5 等开放模型架构,训练出 5 款 Longevity-LLM,参数量从 0.6B 到 9B。训练语料超过 72 万条提示词,集中覆盖 DNA 甲基化、转录组、蛋白质组、血液检测、遗传扰动以及衰老相关知识等任务。

(来源:Cell)
打开网易新闻 查看精彩图片
(来源:Cell)

在 LongevityBench 的 17 项任务综合排名中,9B 参数的 L-Qwen3.5-9B 排名第一,综合排名分数为 4.4;2.6B 的 L-LFM2-2.6B 排名第二,1.7B 的 L-Qwen3-1.7B 排名第三。作为对照,Gemini 3.1 Pro 和 Claude Opus 4.6 分列第四和第五。这里的分数是跨任务的综合排名指标,数值越低越好,并不意味着 L-Qwen3.5-9B 在每一个任务上都超过这些通用模型。

一些单项任务上的差异更直观。

例如,在 GEO 数据集的 DNA 甲基化年龄比较任务中,L-Qwen3.5-9B 的一致率达到 0.868;在 Olink 蛋白质组年龄预测任务中,0.6B 参数的 L-Qwen3-0.6B 模型将平均绝对误差控制在 5.7 年,最佳通用前沿模型则为 10.1 年;在 NHANES 的 10 年死亡风险预测任务中,该模型的平衡准确率达到 0.890。

Liquid AI 公布的结果也显示,在根据临床指标比较年龄、判断基因表达随年龄变化的方向、根据转录组判断年龄组,以及根据 DNA 甲基化和蛋白质组比较年龄等任务中,1.2B 和 2.6B 的 LFM2 专用模型都在部分任务上超过了被测试的通用前沿模型。

研究人员还进行了消融实验:每次从输入中删除一组具有明确生物学意义的特征,再观察模型置信度和预测结果如何变化。结果显示,去掉部分关键生物特征后,模型对正确答案的置信度会下降,一些原本正确的预测也会变错,说明模型的判断确实依赖于部分输入数据。

不过,这类结果只能说明模型使用了这些生物学特征进行预测,并不能由此推导真实生物学中的因果关系。

从模型评测到科研 Agent,AI 开始参与衰老分析流程

研究并没有停留在 benchmark 和模型训练上。团队进一步把表现较好的 L-Qwen3.5-9B 接入 Longevity Claw,尝试让模型参与更加完整的衰老研究流程。

Longevity Claw 是一个面向衰老研究的 Agent 系统。大模型负责理解研究问题、规划分析步骤,再调用衰老时钟、基因集富集、群体分析、文献检索和候选靶点评估等工具,并根据中间结果决定下一步操作。

(来源:Cell)
打开网易新闻 查看精彩图片
(来源:Cell)

公开版本已经整合 233 种衰老时钟,覆盖 DNA 甲基化、蛋白质组、转录组等多种数据,同时还可以连接 PubMed、DrugAge 等外部资源。

研究人员随后让系统围绕 14 类衰老特征开展候选靶点搜索。Longevity Claw 最终提出 328 个潜在干预基因。

研究团队再将这些候选基因与另一套独立发表、具有实验支持的衰老相关靶点集合进行比较,结果发现,部分候选集合中已有衰老相关基因的富集程度最高达到 5.6 倍。

这项结果主要用于验证系统筛选出的候选基因是否包含已有生物学信号,并不意味着 AI 已经发现了 328 个可以用于抗衰老治疗的新靶点。候选基因是否真正影响衰老过程,仍然需要进一步通过细胞、动物等实验进行验证。

Nature 在对这项工作的报道中也提到,目前衰老研究本身仍面临一个基础问题:不同“衰老时钟”可能反映不同维度的生物学变化。因此,无论是根据 DNA 甲基化、蛋白质组还是其他数据预测出的“生物年龄”,都不能简单等同于人体真实衰老程度。

从整项工作来看,研究团队实际上建立了一套从评测到应用的完整工具链:LongevityBench 用来测试模型能否处理衰老数据,Longevity-LLMs 用来训练针对这一领域的专用模型,Longevity Claw 则进一步把模型接入真实的科研分析工具。

目前,相关 benchmark、模型和工具已经公开,研究人员可以进一步利用这些资源测试新的模型,或将其用于其他衰老生物学研究。

1.https://www.nature.com/articles/d41586-026-02913-7

2.Zhavoronkov, Alex, et al. “An Open Benchmark and Language Models for AI in Aging Biology.” Cell, vol. 189, no. 19, 17 Sept. 2026, pp. 5980-5994.e8, 3.https://doi.org/10.1016/j.cell.2026.08.026.