AI制药赛道热了好几年,但一个现实的问题始终绕不开。

很多AIDD模型在公开数据集上跑分漂亮,一落地到真实研发项目,却很难复现同样的效果。

这种跑分与实际的差距,就跟用图灵测试来评判一款大模型是否聪明一样,难以回答行业最关心的问题:

AI模型在实际药物研发项目中到底能不能落地?

过去,行业普遍强调高质量数据的重要性。但对于AI制药而言,仅有高质量数据还远远不够,还需要一套经验证的评价标准。

正如CASP(国际蛋白质结构预测竞赛)的意义远不止一场比赛,它为结构预测的发展指明了方向,最终诞生了AlphaFold这一诺奖成果。

然而,药物研发远比蛋白质结构预测更加复杂。

理想的评价体系,既要能衡量AI模型在真实研发任务中的决策表现,还要进一步验证这些决策最终是否指向可临床转化的分子。

近日,英矽智能在模型训练框架MMAI Gym中发布DDD Benchmarks,并将其定位为“药物研发基准评估”,尝试为这一问题提供一种新的评估思路。

打开网易新闻 查看精彩图片

它究竟如何设计?能否有效识别模型在分布外任务中的泛化能力?又能否进一步验证AI决策是否能够指向具有临床转化潜力的候选分子?

这些问题,构成了理解DDD Benchmarks的关键。

打开网易新闻 查看精彩图片

药物研发需要什么样的评测模型?

要理解DDD Benchmarks,首先要看到传统公开Benchmark面临的局限。

与通用人工智能可以依赖大规模互联网数据集不同,药物发现数据具有高度异构、样本不平衡、噪声多、获取成本高等特点。

更关键的是,公开数据与真实研发数据之间,也可能存在明显的分布差异。

因此,模型在公开数据集上取得高分,也不一定意味着它能够胜任真正的药物研发能力。

公开数据集可能存在样本重复、数据污染、正负样本失衡等问题。模型取得高分,有时来自对已有数据规律的记忆,而不是对新问题的真正理解。

更能反映实际能力的,反而是药企长期积累的真实项目数据,包括大量没有进入论文、专利或公共数据库的实验结果。但这类数据通常属于企业核心资产,不可能被大规模公开。

这就形成了行业面临的现实矛盾:最有价值的数据难以开放,而缺少真实数据支撑的Benchmark又很难充分评估模型的实际能力。

另外,现有测评普遍停留在单点任务上,例如分子亲和力预测、ADMET预测、分子生成或逆合成路线设计。

这些任务可以帮助研究者了解模型的局部能力,但药物研发本身是一个多环节过程,涉及靶点研究、虚拟筛选、分子设计、合成路线规划、药代动力学和毒理评价等多个阶段。单项任务上的优势,并不一定能够延续到完整研发流程中。

AI领域的头部公司已经开始意识到Benchmark的重要性。OpenAI推出GeneBench-Pro、LifeSciBench等生命科学基准,推动了科研领域模型走向标准化评估。

但对AI制药而言,这仍然不够。

产业真正需要的,不只是更大的题库,而是一套更接近研发实践的测评体系:既要覆盖关键研发任务,也要纳入分布外数据和失败样本;既要考察模型的单点能力,也观察其在连续研发决策中的表现;既要看模型能不能给出正确答案,更要看这些答案能否通过实验验证。

DDD Benchmarks正是在这一背景下推出的。它试图将评估范围从单项指标扩展到多个研发任务,并进一步观察模型在候选药物筛选过程中的连续决策能力。

打开网易新闻 查看精彩图片

从会做题,到会做药

根据英矽智能公布的信息,DDD Benchmarks由两个主要模块组成。

一方面是药物研发基础套件(Drug Discovery Foundations),包含300多套测试任务,覆盖疾病生物学、分子性质预测与优化、逆合成路线设计、基于结构的分子设计以及临床开发等多个方向。

它解决的是一个基础问题:一个模型,到底具备哪些基础药物研发能力?

与传统公开数据集相比,该模块引入了分布外检测数据集(ODD),并对部分公开数据进行了清洗和处理,以降低模型因接触过相似训练样本而获得高分的可能性。

虽然,分布外检测数据集(ODD)不能完全等同于真实研发环境,但至少可以进一步检验模型面对没见过的新分子、新任务、新数据分布时,还能不能做对。

第二部分是候选药物核心套件(Drug Candidate Essentials)。

跟上述能力相比,它的关注点发生了巨大的变化。

它不再考察一个孤立的预测任务,而是把模型放进从苗头化合物筛选、分子优化,到候选药物提名的连续决策过程中。

这更接近真正的药物研发。

在这一过程中,模型需要同时考虑活性、选择性、药代动力学、毒理性质、可合成性等多方面约束。任何一个环节的判断出现偏差,都可能影响后续研发结果。

因此,这类端到端评估更接近研发人员面对的真实问题,也能补充单项任务Benchmark难以覆盖的部分。

当然,它也面临新的挑战:不同靶点和疾病如何比较?不同任务如何统一评分?最终实验结果又该如何归因于模型决策?

DDD Benchmarks的实际效果,还需要通过更多模型接入、第三方验证和长期使用来检验。

在评测流程上,英矽智能表示,符合API标准的模型可以接入测试,测评结果将根据基准数据进行评分,并可在获得授权后发布至公开排行榜。

若这一流程能够持续保持开放和透明,可以为不同模型之间建立更加统一的比较框架。

对药企而言,这类评估可以作为筛选AI工具和研发合作方的参考;对模型公司而言,它提供了一个相对统一的测试框架;对学术研究而言,也可能推动药物研发模型从单一指标比较走向更接近产业需求的评价方式。

打开网易新闻 查看精彩图片

但需要强调的是,Benchmark分数并不能替代真实实验,也不能直接等同于药物研发成功率。它更适合被视为研发决策和模型筛选中的一个参考维度。

打开网易新闻 查看精彩图片

从研发实战中来,到实战中去

DDD Benchmarks并不是凭空出现的。

它背后依托的是英矽智能在AI药物研发上的长期实践,以及其Pharma.AI平台和MMAI Gym训练框架。

公司披露的信息显示,MMAI Gym覆盖多类药物研发基准测试,整合了超过1000个药物研发基准测试和约1200亿token制药领域数据。

也就是说,DDD Benchmarks并非单纯从公开数据集中重新组合测试题,更像是一次把内部研发经验转化为外部评估能力的尝试

英矽智能自身的研发管线,也提供了观察AI制药实际效果的一个窗口。

根据公司披露,截至目前,其内部管线已提名33款临床前候选化合物(PCC),多款项目进入临床阶段。Rentosertib项目已推进至III期临床,是目前AI制药领域受到关注的后期临床项目之一。

从项目启动到候选药物提名的周期、进入临床的项目数量以及对外合作情况,可以在一定程度上反映AI对研发流程的影响。

药物研发最终受到靶点、疾病、项目起点、研发团队和临床策略等多重因素影响。

因此,真正有价值的不是证明某个模型创造了多少成功,而是建立模型能力与研发结果之间越来越清晰的联系。

英矽智能同时在探索将AI能力应用于衰老机制和长寿科学研究。公司已开展相关基础模型和多组学研究,并与外部机构展开合作。这一方向仍处于持续探索阶段,其科学价值和商业化前景还需要更多研究和长期验证。

从业务模式看,英矽智能一方面推进自有管线和对外授权,另一方面也在建设模型训练、研发平台和评估服务。DDD Benchmarks的推出,可以被视为其将内部研发经验产品化、平台化的一次尝试。

这类尝试能否形成可持续的行业基础设施,关键不只在于测试任务数量,还取决于几个因素:数据是否具有代表性,评测结果是否可复现,流程是否足够透明,是否有第三方参与,以及模型分数能否与真实实验结果建立稳定联系。

从这个角度看,DDD Benchmarks的意义不在于替代现有Benchmark,也不在于单独定义什么是“最好的”药物研发模型,而在于提供另一种评估视角:

将模型能力放回真实研发任务和连续决策中进行观察。

打开网易新闻 查看精彩图片

评测只是起点,落地才是答案

AI制药能否进一步走向规模化应用,最终仍要由实验结果、临床进展和商业化表现共同验证。Benchmark可以帮助行业建立更清晰的比较框架,但它只是其中的一环。

过去几年,AI制药的讨论更多集中在模型规模、论文成绩和公开数据集排名上。随着技术进入真实研发阶段,行业开始关注另一个问题:模型能否在复杂、不确定且成本高昂的研发环境中持续产生有效决策。

DDD Benchmarks提供了一种尝试,即把评估从单项任务扩展到多个研发环节,并引入分布外数据和候选药物决策链条。它能否成为更广泛认可的行业标准,还有待后续的开放使用和独立验证。

对英矽智能而言,这也是其从AI药物研发实践者向平台和评估服务提供者延伸的一步。

对整个行业而言,真正重要的或许不是再增加一个排行榜,而是逐步建立模型能力与实验结果之间更可靠的联系。

当AI模型的表现能够在真实项目中被持续记录、比较和验证,AI制药才可能从概念展示进入更稳定的研发应用阶段。

— The End—

打开网易新闻 查看精彩图片