撰文丨王聪
编辑丨王多鱼
排版丨水成文
衰老是导致人类大多数疾病发病率和死亡率的主要风险因素,心血管疾病、神经退行性疾病、癌症以及代谢紊乱等等,都会随着年龄增长而显著增加,但消除任何一种病理状态也只能适度延长预期寿命,因为整体功能衰退仍将持续。要有意义地延长人类寿命(即延长健康寿命),需要在分子水平上系统性改变衰老过程,以预防衰老相关疾病的发生。
在过去几十年中,科学们已开展了大量组学研究来描述衰老的驱动因素并发现可利用的分子靶点。这些研究产生了大型数据集,捕获了基因表达、DNA 甲基化、蛋白质组学和临床生物标志物中与衰老相关的变化,但目前尚无系统性的框架来评估人工智能(AI)系统能否在衰老生物学背景下解读这些异质性发现。然而,AI 技术的最新进展带来了希望,表明这种解读如今已触手可及,但前提是能够对其进行严格的测试。
2026 年 9 月 17 日,英矽智能(Insilico Medicine,HKEX:3696)联合 Liquid AI、巴克衰老研究所、哈佛医学院及布莱根妇女医院的研究人员,在国际顶尖学术期刊 Cell 上发表了题为:An open benchmark and language models for AI in aging biology 的研究论文。该论文还被选为当期封面论文。
该研究推出了一套开放式 AI 工具包,包括——
LongevityBench(用于评估 AI 在多维度衰老生物学中推理能力的开放基准测试);
Longevity-LLM(基于临床和多组学衰老数据训练的一系列轻量级开源大语言模型);
Longevity Claw(可自主调用专业长寿研究工具的开源 AI 智能体平台,用于加速衰老生物学研究和长寿疗法开发,支持科研人员发现并评估潜在衰老干预靶点)。
该研究推出了 LongevityBench,这是一个包含 5 个生物学数据领域共 17 项任务的开放基准测试,用于评估 AI 系统在人类衰老研究中的表现。封面团队将该基准以几何浮雕形式呈现:17 个节点构成数字“1”,位于一个带有小孔的平面之上,下方悬浮着一个过大的球体。从上到下看,这些元素让人联想到一个趋向于零的分数;而那个因过大而无法穿过小孔的球体,则形象地揭示了该研究的核心发现:仅凭模型参数规模并不能确保在专门的衰老相关任务上取得成功,而紧凑的、针对衰老领域调整的模型却能媲美甚至超越规模大得多的通用模型。
为什么需要给 AI 出一套“衰老考卷”
过去二十年,衰老研究积累了大量数据:DNA 甲基化、转录组、蛋白组、临床检验、基因互作……理论上,AI 尤其是大语言模型(LLM)应该能把这些数据读进去,回答“这个人老得多快”、“哪个基因值得做成抗衰药靶点”等问题。
但现实是:现有生物医学基准大多考的是“背知识点”——某基因功能是什么、某篇文献结论是什么。AI 模型只要预训练时见过原文,就能拿高分,因此,拿高分并不等于它真的看懂了。
而现在,英矽智能联合 Liquid AI、巴克衰老研究所及哈佛医学院/布莱根妇女医院等,发布了一套开源方案:LongevityBench测试基准、Longevity-LLM系列模型、Longevity Claw智能体平台。核心问题只有一个——不给检索、不给工具,只把原始组学数据喂给 AI 模型,它们能不能像人类科学家一样推理?
LongevityBench:五类数据、四种题型
LongevityBench测试基准包含 17 个任务,覆盖 5 个生物数据域:
临床:NHANES 体检/生化/随访,做年龄分类、回归、配对谁更老、死亡与否、谁活更久等;
表观基因组:GEO 的 DNA 甲基化,配对/分年代/回归预测年龄;
转录组:GTEx 多组织基因表达,配对比较、分年龄组、部分基因补全;
蛋白组:Olink 血浆蛋白,配对/分年代/回归/条件生成;
遗传互作:OpenGenes 预测基因随龄上调下调;SynergyAge 预测果蝇/小鼠单突或双突对寿命影响。
题型分成四类:二分类、两两比较、多分类、数值回归。总 prompt 约 25457 条。部分 DNAm 任务单条中位数超 2 万 token,因为要把上百个 CpG 位点连同基因组注释一起写进上下文。 防“背答案”做了几层:NHANES只用 1999/2001 两波做评测、2003–2017 做训练;GEO 继承 study 级拆分;GTEx/Olink 按受试者拆;OpenGenes 把基因名掩成“gene-X”只给功能/互作/组织信息;SynergyAge 评测用果蝇和小鼠、训练用线虫。也就是说,评测集和训练集不共享具体样本。
前沿大模型考得怎么样:没有全能冠军
研究团队评估了 6 家 AI 公司(OpenAI、Google、Anthropic、xAI、DeepSeek、月之暗面)的 18 个前沿通用模型(其中,GPT-o3、GPT-o4-mini 因可解析回答率低于 80% 被移出主对比),主榜单最终 26 个模型:16 个前沿通用大模型 + 5 个自研长寿大模型 + 5个基座模型。
结果有几个反直觉点——
没有哪个前沿 AI 模型能够通吃 17 题。临床类相对强,原始组学年龄最弱。
DNA 甲基化年龄最难。GEO 配对最好的前沿 AI 模型一致率仅约 0.69;GTEx 转录组配对多数不过 0.56,部分甚至低于随机 0.50。
蛋白组出现“专家基线打脸通用大模型”。Olink 配对有个蛋白时钟基线一致率 0.749,而最好的前沿 AI 模型 Gemini-3.1-Pro 也仅 0.703,GPT-4.1 甚至接近随机。
格式一变成绩就变。同一 GTEx 数据改成“可能同年龄组”的三选一,所有模型一致率降 8%-19%;OpenGenes 取消基因名掩码,只有中低排名模型小幅提升,顶级模型几乎不吃这套——说明掩码确实挡住了检索捷径。
简而言之:前沿通用大模型会聊天、会引文献,但让它从组学数据中直接评估年龄,仍然存在困难。
小模型逆袭:Longevity-LLM 0.6B–9B
研究团队开发了一系列共 5 款精简型开源长寿大语言模型——Longevity-LLM,分别是 L-Qwen3-0.6B、L-Qwen3-1.7B、L-LFM2-1.2B、L-LFM2-2.6B、L-Qwen3.5-9B,这些模型基于 Liquid AI(例如 LFM2 架构)和阿里巴巴(例如 Qwen3 及 Qwen3.5 家族)的开源架构打造,模型参数在 6 亿至 90 亿之间,依托英矽智能专为 AI4S 设计的训练与评估框架 MMAI Gym for Science,利用衰老领域的专属临床数据和多组学数据进行了深度微调。
评测结果显示,尽管模型参数规模相对较小,但这些经过微调的专有长寿模型在 LongevityBench 上的整体表现仍能达到或超过全部 16 个接受测试的前沿通用大语言模型。 其中,表现最佳的L-Qwen3.5-9B在该研究评估的所有 AI 模型中取得了最高综合得分,其以远低于前沿通用大模型的参数规模,超过了包括 Gemini 3.1 Pro 在内的所有前沿通用模型。即使是参数规模最小的专用模型(仅 6 亿参数),其表现也优于大多数接受测试的前沿通用模型。
Longevity Claw:把小模型放进“抗衰靶点工作流”
通过测试基准证明能力后,研究团队进一步验证了这些模型能否走出基准测试、在实际科研中发挥作用,他们将表现最佳的L-Qwen3.5-9B集成至最新开源的衰老研究智能体平台——Longevity Claw中。
Longevity Claw把 L-Qwen3.5-9B 接上三件套工具:基因集富集、衰老时钟计算、人群画像。让它按 14 个衰老标志各提名 30 个候选基因,并用置信度、可成药性、安全性、新颖性、商业潜力、机制清晰度六维打分,重复 6 次去重,得到 328 个抗衰老干预的潜在靶点。
其中,Longevity Claw提出的KDM1A基因在另一项已发表的独立研究中被证实为兼具抗衰老与抗肿瘤功效的“双重作用”靶点。这初步表明了 Longevity Claw 有能力发掘出高生物学可信度、且此前可能被长寿药物研发忽视的有潜力靶点。
总的来说,该研究推出了LongevityBench,这是一个涵盖五个生物学数据领域的 17 项任务的开源评估套件,并利用它对来自六个 AI 公司的 18 个前沿 AI 大模型进行了测评,结果显示,尽管 AI 大模型近年来取得了显著进展,但没有任何单一 AI 大模型在所有任务上均表现最优。研究团队还针对特定衰老领域数据,对 5 个多任务长寿大语言模型(Longevity-LLM)进行了微调。这些参数量较小(0.6B–9B)的Longevity-LLM在 LongevityBench 上的表现与远超其规模的前沿 AI 大模型相当甚至更优,表明通用语言模型可被有效适配用于结构化组学任务。
更重要的是,研究团队开源发布了LongevityBench测试基准、Longevity-LLM模型以及Longevity Claw智能体平台,支持衰老领域研究人员发现并评估潜在衰老干预靶点。
论文链接:
https://www.cell.com/cell/fulltext/S0092-8674(26)00999-2
热门跟贴