*仅供医学专业人士阅读参考
在衰老研究领域,人工智能(AI)已经成为不可或缺的工具。但AI真的懂衰老吗?目前,大语言模型(LLM)已经能够做到回答大量的生物医学问题,但这些回答可能来自早就存在的论文、数据库或互联网文本,并不意味着它们真的具备从原始实验数据中推导真实科学结论的能力。
但从今天开始,我们真正拥有了能判别AI是否“懂衰老”的工具。
今日,《细胞》杂志以封面研究的形式发表了英矽智能领衔,与Liquid AI、巴克衰老研究所、哈佛医学院及布莱根妇女医院合作的重磅论文[1],该研究首次推出了开源的AI衰老研究工具包,包括全球首个开源衰老生物学多组学评估基准测试 LongevityBench,并证实经过特定领域数据微调的轻量级模型Longevity-LLMs(0.6B–9B参数)不仅能精准解读复杂的多组学实验数据,更在多项衰老相关核心推理任务中全面击败了Gemini-3.1-Pro、Claude Opus-4.6及GPT-5等前沿千亿级通用大模型。
《自然》杂志配发评论称[2],这将为下一代AI模型的发展提供重要的参考依据。
“大”模型或许不是衰老研究的出路
人类衰老是引发心血管疾病、神经退行性病变、癌症及代谢紊乱等绝大多数重大慢性疾病的核心风险因素。过去二十年间,随着多组学(Omics)高通量检测技术的爆发,科学界积累了海量的DNA甲基化、转录组学、蛋白质组学及临床生化指标数据。然而,如何从这些浩如烟海、高度异构的原始实验测量数据中,准确推导出系统性的衰老生物学机制与治疗靶点,始终是制约长寿医学(Longevity Medicine)发展的核心痛点。
LLM在医学文献总结、临床问答及科研辅助中展现出惊人潜力。然而,当前绝大多数生物医学AI 基准测试(Benchmark)仅停留在自然语言文本问答层面。这种评估模式存在致命缺陷:AI极易通过预训练语料库中的文本记忆(Memorization)直接“背出答案”,而非真正具备理解原始实验数据的生物学推理能力。
面对严谨的经验生物学,通用大模型常因“缺乏对底层生物特性的内化”而给出看似流畅却违背事实的伪结论(即AI幻觉),这严重威胁了科学研究的严谨性。
为了系统评估AI是否真正具备解读原始生物学数据的能力,研究团队打造了LongevityBench (LB)基准测试集。该基准包含17项评估任务,横跨5大生物数据领域:临床生化、表观遗传学、转录组学、蛋白质组学、遗传学与基因互作,并设计了4种问题格式和25457个结构化prompt,评估了18款主流通用大模型(包括Gemini-3.1-Pro、Claude Opus-4.6、GPT-5/5.2、DeepSeek-V3.2/R1、Kimi-K2.5、Grok-4.3)对多组学年龄预测、死亡风险评估及基因调控的推理能力。
遗憾的是,没有任何一个通用大模型能够在所有任务上全面领先,如临床生化任务中,Gemini-3.1-Pro展现出商业模型中的最高水准,但表现仍不如该领域的经典机器学习模型。
在表观遗传与转录组任务中,由于prompt输入的是动态抽样的多组学特征,通用大模型的推理极其不稳定。
从组学数据预测年龄是最困难的任务。例如在DNA甲基化样本年龄对比任务中,表现最好的通用模型Kimi-K2.5一致性指数(Concordance)仅为0.69;而在蛋白质组学年龄对比中,蛋白质时钟的一致性达0.749,而通用大模型最佳者仅为 0.703(Gemini-3.1-Pro),GPT-4.1的表现甚至与随机盲猜无异。
通用大模型在很多任务的表现不尽如人意
此外,研究者发现通用大模型对提问方式高度敏感,不同的问题表达形式会显著影响结果,说明通用大模型在结构化生物数据推理上仍然面对相当的稳定性问题。
“大”模型,看来并不是衰老科研AI最好的出路。
“专模”专用,性能更佳
那么如何提升模型对衰老生物学数据处理的表现呢?
研究团队基于Qwen3/3.5及Liquid AI的LFM2开源基座,微调训练了5款参数量仅在0.6B至9B之间的轻量级专用模型Longevity-LLMs(L-LLMs)。
在与通用大模型的比较中,L-LLMs取得了瞩目的成绩。9B参数的L-Qwen3.5-9B在测试中性能最佳,综合排名列总榜第一;仅0.6B参数的L-Qwen3-0.6B也名列第六,超越了大部分千亿/万亿参数的通用大模型。
L-LLMs表现极佳,L-Qwen3.5-9B断层第一
举例来说,在血浆蛋白质组Profile条件生成任务中,通用大模型的Jaccard相似度接近0,且预测的蛋白质高度局限于少数常见热点蛋白,仅覆盖47%的蛋白词汇表;L-LFM2-2.6B平均Jaccard相似度提升至0.17,且涵盖了2583种独特蛋白质,覆盖了91%的蛋白质词汇表。这表明L-LLMs真实内化了底层组学数据的完整统计分布,而非简单记忆论文热点。
研究者对L-Qwen3.5-9B进行了1922个prompt的特征消融测试,删除特定面板数据会使模型的预测性能显著下降,证实其预测严格依赖于真实的生物学信号分布。
以上结果足以说明,通过特定领域的结构化组学数据微调,轻量级模型无需依赖庞大的算力,即可高效适配复杂的生物多组学任务。
全新的科研综合智能体
研究团队还公开发布了结合L-LLMs与衰老时钟(Biolearn)、基因集富集分析(GSEA)等工具的科研综合智能体接口Longevity Claw,形成了从接受数据、调用工具、分析整合、自动化汇总到形成下一步行动的完整科研工作流。
研究者将Longevity Claw应用于14个衰老标志分类,开展无预设答案的治疗靶点探索。模型需要为候选靶点输出包含信心度、可药用性、安全性、新颖性、商业潜力与机制清晰度6个维度的自动化评分。
经过6轮独立重复与去重,Longevity Claw最终输出了328个候选靶点,与2022年发表在Aging上的基于PandaOmics AI平台的独立数据集相比[3],核心靶点集展现出了高达5.6倍的显著统计学富集度。6轮筛选中5次提名的KDM1A,已经在秀丽隐杆线虫研究中被证实具备抗衰和抗肿瘤的双重潜力。
小结
LongevityBench、Longevity-LLMs及Longevity Claw的开源发布,标志着生物医药AI评估与应用进入了全新的阶段。该研究证明了在多组学推理任务中,经过领域强化训练的轻量级模型能够以更低的算力成本和更高的隐私安全性,达到甚至超越千亿级通用大模型的性能水准。
作为专注于生成式AI驱动药物研发与抗衰老生物学的先锋企业,英矽智能已经取得了相当的成绩,其提出的全球首个AI驱动新药Rentosertib在针对特发性肺纤维化(IPF)的IIa期临床试验中,。
随着这套开源AI工具包的发布,全球科研人员将能够更好地利用多组学数据与领域大模型,共同推动长寿医学与新药研发的变革。
欢迎大家关注我们在小宇宙上的播客栏目——药研片语,
欢迎大家前去收听并与我们交流~
参考资料:
[1]Zhavoronkov, Alex, et al. "An Open Benchmark and Language Models for AI in Aging Biology." Cell, vol. 189, 2026, pp. 1–15. ScienceDirect,https://doi.org/10.1016/j.cell.2026.08.026.
[2]https://www.nature.com/articles/d41586-026-02913-7
[3]Pun, Frank W., et al. "Hallmarks of Aging-Based Dual-Purpose Disease and Age-Associated Targets Predicted Using PandaOmics AI-Powered Discovery Engine." Aging, vol. 14, no. 6, 2022, pp. 2475–506. https://doi.org/10.18632/aging.203960.
本文作者丨代丝雨