这项由上海人工智能实验室联合香港中文大学、上海交通大学、复旦大学、悉尼大学、南京大学、牛津大学、中国科学技术大学、中国科学院上海药物研究所及斯坦福大学等多家机构共同完成的研究,以预印本形式于2026年7月8日发布于arXiv平台,论文编号为arXiv:2607.07708。感兴趣的读者可通过该编号检索到完整论文。
科学研究有一个永恒的核心问题:为什么同样是碳原子组成的东西,钻石坚硬无比、石墨却软得能写字?为什么一个蛋白质分子能精准找到细胞里的某个靶点,另一个结构相近的却毫无反应?为什么改变几个原子的排列,一种药物就从无效变成有效?归根结底,这些问题都指向同一件事:物质的结构决定了它的功能和性质。
生物学家、化学家和材料科学家几十年来都在研究这种"结构-性质关系"。人工智能的出现让这个过程加速了不少——它可以快速翻阅海量数据、筛选大量候选分子。但已有的AI工具面临一个尴尬处境:要么能理解结构却不会解释推理过程,要么能流畅对话却把复杂的三维结构压缩成一串文字描述,导致关键的空间信息大量流失。打个比方,这就像你把一张精密的建筑设计图拍成一张模糊的照片,然后让AI根据照片来判断这栋楼能不能抗八级地震——信息损失太多,判断自然不可靠。
上海人工智能实验室等机构的研究团队为此开发了SciReasoner这一系统,试图从根本上解决这个问题:让AI真正"读懂"科学结构,而不仅仅是"看到"它。
**一、为什么现有AI工具在科学推理上力不从心**
现有的科学AI工具大致分为两派,却各有明显短板。
一派是以ChatGPT为代表的大型语言模型。它们知识渊博,能流利地回答各种科学问题,但当面对蛋白质的三维折叠结构、分子的立体构型或者晶体的周期性排列时,它们只能把这些信息转化成文字描述来处理。把一个三维分子结构"翻译"成文字,就像把一首交响乐"翻译"成乐谱的文字描述——无论描述多么详尽,总有些关键信息在转换中消失了。
另一派是专门针对某一类分子或材料训练的专业模型。这类工具能直接处理分子图、蛋白质结构或晶格数据,预测准确率往往不错,但它们通常只给出一个数字或分类标签,却无法告诉你"为什么"——这个分子为什么具备这样的活性?这块晶体为什么有这么宽的带隙?缺少推理过程,研究人员就无法验证AI的判断是否真正有科学依据,还是只是碰巧猜对了。
SciReasoner尝试打通这两派之间的隔阂,做到既能准确处理原始结构信息,又能像人类专家一样,把推理过程清晰地展示出来,让每一步结论都有明确的结构证据支撑。
**二、把三维结构变成AI能真正理解的"语言"**
SciReasoner面临的第一个技术挑战,是如何把蛋白质、分子和晶体这三类截然不同的科学对象,转化成一个统一的、AI能深度理解的表示形式。
研究团队的解决方案是为每类科学对象设计专用的"结构编码器",把三维空间信息压缩成一串特殊的符号序列——可以把它理解成一种专门用于科学结构的"文字",既保留了关键的空间信息,又能和普通语言文字混合在一起处理。
对于蛋白质,团队采用了Foldseek的3Di编码方案。蛋白质是由氨基酸链折叠而成的,每个氨基酸在三维空间里处于特定位置,形成α螺旋、β折叠等特征性形状。Foldseek把每个氨基酸所在局部区域的几何形状,编码成一个字母符号。连续几个V和L字母意味着这段蛋白质处于稳定的α螺旋中,D和P的组合则代表转角或延伸链区域。这样,一条几百个氨基酸的蛋白质,就变成了一串几百个字母的"结构序列",每个字母都对应真实的三维几何信息。
对于小分子,团队使用ConfSeq编码方案。普通的SMILES字符串(一种化学家常用的分子文本表示)只记录了原子之间的连接关系,而ConfSeq在此基础上还记录了扭转角(原子之间的旋转角度)、伪手性(分子中特殊的空间对称性)和键角等三维几何信息,让AI能感知到分子在空间中真实的立体形状。
对于晶体材料,团队采用SLICES编码,把晶体的空间群(描述整个晶体周期性对称性的数学概念,想象成晶体的"建筑风格",如立方、六方、单斜等)、原子类型、以及原子之间如何跨越晶胞边界相连等关键信息,都编码进一个紧凑的字符串里。
更重要的是,研究团队还专门为SciReasoner开发了一套新的分词器(tokenizer,可以理解成把文字切分成基本单元的工具)。普通的语言模型用的通用分词器,会把化学式或结构编码字符串按照英文单词的习惯随意切分,往往把一个完整的化学官能团或结构片段切成不完整的碎片,就像把"苯环"切成了"苯"和"环",甚至更破碎的片段,语义完全被破坏了。SciReasoner的专用分词器则识别这些科学符号的完整含义,以化学或结构上有意义的单元为边界切分——这使得处理分子信息时所需的符号数量减少了约30%,同时保留了正确的化学语义。
**三、三阶段预训练:让AI从"认识字"到"理解科学"**
拥有了专用的结构编码语言之后,如何让AI真正学会使用它,成了下一个关键问题。研究团队设计了一个三阶段的持续预训练流程,整个过程就像让一个精通语文的学生逐步学习化学专业知识:先认识专业符号,再深入理解专业内容,最后练习回答专业问题。
第一阶段叫做"热身训练"。这一阶段的目标很明确:让新引入的结构符号和原有的语言知识建立初步联系,但又不破坏模型已有的推理能力。为此,研究团队暂时冻结了模型的主体(核心Transformer层),只训练新增的结构词汇嵌入层和输入输出接口,让模型在这个阶段只专注于学习"这个结构符号表示什么基本概念",就像给一个汉语母语者先学习化学元素符号的发音和基本含义,而不急于让他理解复杂的化学反应。
第二阶段叫做"全参数训练"。热身完成后,模型的所有参数全部开放训练,在包含蛋白质、DNA、RNA、小分子、晶体以及大量科学文献的多模态数据集上进行深度学习。这个阶段使用了一个"热身-稳定-衰减"的学习率调度策略:学习率先缓慢上升(防止模型一开始步子太大走偏),在中间大部分时间保持稳定(让模型充分学习),最后缓慢下降(让模型收敛到稳定状态)。训练数据来源极为丰富,蛋白质方面使用了UniProt数据库里数百万个蛋白质序列及其对应的AlphaFold预测结构,并关联了PubMed文献和UniProtKB的功能注释;小分子方面整合了ChEMBL、BindingDB等数据库的分子结构和活性数据,以及USPTO反应数据库的大量化学反应记录;材料方面则使用了Materials Project、JARVIS-DFT、GNoME等多个材料数据库的晶体结构和性质数据;DNA和RNA方面则来自RNAcentral和NCBI基因组数据库。
第三阶段叫做"退火训练"。这一阶段增加了更多问答风格的训练数据,让模型开始学习"被提问后给出有结构的答案",为后续的推理能力训练打下基础。
整个预训练在大约140亿参数的Qwen3-14B语言模型基础上进行,最终得到的SciReasoner基础模型(SciReasoner Base),已经具备了跨三个科学领域的结构-文本对齐能力。
**四、从"知道答案"到"能解释推理":自举式推理训练**
预训练后的SciReasoner Base已经能处理各类科学任务,但它给出的答案往往缺乏清晰的推理过程,就像一个知识渊博但不善于解释的专家——他知道答案,但说不清楚为什么。为了让模型真正能够展示有据可查的推理链条,研究团队设计了一套他们称之为"自举式原生结构推理"的后训练框架。
这个框架分为两个阶段,思路颇为巧妙。
第一个阶段叫做"领域内结构证据锚定"。研究团队注意到,蛋白质、分子和晶体这三类任务的推理逻辑差异很大,如果把所有任务混在一起训练,模型会陷入"既要说蛋白质折叠,又要说化学反应,又要说晶体对称性"的混乱状态,最终什么都说不好。于是他们先分别为三个领域训练专门的"领域专家"模型:蛋白质结构专家、分子结构专家和材料结构专家。每个专家模型只需要学好自己领域的推理方式,不受其他领域干扰。
训练这些专家模型时,研究团队使用了强化学习(RL)的方法,结合了一种叫做DAPO的优化算法。强化学习的思路类似于训练一只小狗:当它做对了,就给奖励;做错了,就不给奖励。对于SciReasoner,"做对"意味着不仅最终答案准确,而且推理过程中引用的结构片段真实存在于输入数据中,推理逻辑符合该领域的科学原理。为了让训练更高效,研究团队还专门筛选出"中等难度"的训练样本——太简单的问题(模型几乎次次都能答对的)和太难的问题(模型几乎次次都答错的)都被排除,只保留模型有时对有时错的那部分,因为这部分问题的训练信号最有价值,能真正推动模型进步。
第二个阶段叫做"跨领域推理整合"。三个领域专家分别训练完成后,研究团队让每个专家模型在自己擅长的题目上生成大量高质量的推理轨迹(也就是完整的思考过程)。然后,把三个领域的推理轨迹汇总在一起,用来训练一个统一的SciReasoner最终模型,让它同时继承三个领域专家的推理能力,而不是从零开始做跨领域融合。这种"先分后合"的策略,有效避免了直接进行多领域混合训练时容易出现的"推理崩塌"问题——即模型陷入简单、表面化的推理模式,而不是真正进行有深度的结构分析。
**五、蛋白质功能预测:在"孤儿蛋白"上胜出**
研究团队选择了几个有代表性的应用场景来评估SciReasoner,每个场景都专门设计来测试模型是否真正在做"结构驱动的推理",而不是在利用数据中的捷径。
第一个场景是蛋白质的基因本体论(GO)术语预测。基因本体论是生物信息学中描述蛋白质功能的标准词汇体系,分为三个维度:分子功能(这个蛋白质直接做什么,比如"结合ATP")、生物过程(它参与什么生命活动,比如"细胞分裂")和细胞定位(它在细胞的哪个位置工作,比如"细胞核")。准确预测这三类标签,对于理解蛋白质的生物学意义至关重要。
测试使用的是DeepFRI-GO数据集,研究团队还特别排除了预训练数据中与测试集超过30%序列相似度的蛋白质,防止模型靠"认出老朋友"来作答。
整体来看,SciReasoner的Fmax(衡量预测准确度的综合指标,满分1.0)达到了0.59,超过了基于序列相似度的BLAST传统方法(0.55)、基于结构对齐的Foldseek(0.54)、专业蛋白质语言模型ESM2(0.53)和SaProt(0.52),而通用大语言模型DeepSeek-V4-Pro和GPT-5.5则分别只有0.35和0.31。
更能说明问题的是在低同源性蛋白上的表现。研究团队把测试蛋白按照与训练集的序列相似度分成了七个区间,专门分析最难的区间:与训练集相似度不超过30%的蛋白质(这类蛋白几乎找不到"近亲",被戏称为"孤儿蛋白")。在细胞定位这个维度,BLAST在这个难度区间的Fmax只有0.34,ESM2为0.42,而SciReasoner达到了0.55——比ESM2高出了0.13,比BLAST高出了0.21。这意味着当进化信息近乎无用时,SciReasoner能依靠结构本身的信息来做出推断,而不是在做无根据的猜测。
研究团队还专门检验了SciReasoner的注意力分配是否真正聚焦在功能相关的区域。他们选取了已知会与DNA结合的蛋白质,提取了模型在生成"DNA结合"这个GO标签时对每个氨基酸位置的注意力分数,然后检验这些高注意力位置是否与已知的DNA-蛋白质接触位点重合。结果令人印象深刻:对于三个不同的DNA结合蛋白,SciReasoner的高注意力区域与实验确定的结合位点高度吻合,受试者工作特征曲线下面积(AUROC,衡量这种对应程度的指标)分别达到0.91、0.83和0.78,富集倍数(顶部20%注意力位置中真实结合位点的比例相对于随机基准的倍数)分别为4.2倍、3.6倍和3.1倍。换句话说,SciReasoner预测某个蛋白质能结合DNA,不是因为它的序列看起来像某个已知的DNA结合蛋白,而是因为它的结构折叠形成了物理上适合接触DNA的空间构型,模型的"注意力"确实落在了这些物理接触位点上。
研究团队进一步使用GPT-5.5作为评判员,对SciReasoner生成的推理轨迹质量进行打分,评估维度包括整体质量、对输入信息的忠实度、生物学合理性、推理连贯性和功能假说质量。SciReasoner在所有维度上均领先,整体得分8.33分(满分10分),优于未经强化学习训练的版本(7.77分)和DeepSeek-V4-Pro(6.96分)。特别是在"生物学合理性"维度,SciReasoner(8.68分)与DeepSeek-V4-Pro(6.63分)之间的差距最为显著,说明强化学习训练真正提升了推理的科学深度,而不仅仅是文字流畅度。
**六、逆合成规划:一步步还原化学反应的"反推"能力**
第二个应用场景是有机化学中的逆合成规划,也就是给定一个目标分子,让AI推断出哪些原料分子可以通过化学反应合成出它。这是新药研发中非常关键的一步——如果一个候选药物分子合成太困难,它的研发价值就会大打折扣。
测试使用的是USPTO-50K数据集,这是一个包含5万条化学反应记录的标准基准,每条记录给出一个产品分子,要求模型预测正确的原料分子组合。评判标准非常严格:预测的原料分子的标准化表示必须与真实答案完全一致。
SciReasoner在这个任务上的表现格外突出,精确匹配率达到了0.72,超过了此前最佳的专业逆合成模型RSGPT(0.63),提升了0.09个百分点。而通用语言模型Opus-4.7的5次示例学习表现只有0.48。
SciReasoner的推理过程本身也很有价值。对于每个目标分子,它会生成一个分四步走的推理链条:第一步分析产品结构,把整个分子分解成有意义的片段,识别其中的功能团(如酯键、氨基、苯环等);第二步判断最具策略价值的断键位置,即"哪根键断开最合理";第三步给出每个断键产生的原料片段的化学结构;第四步验证这些原料是否化学上合理,以及它们通过正向反应能否确实生成目标产品。整个链条中,每一个中间步骤都以SMILES化学结构片段的形式给出,可以被化学家一步步核验,而不是一个无法追溯的黑盒输出。
研究团队选取了5个典型案例与RSGPT和Opus-4.7进行详细对比,SciReasoner在5个案例中全部给出了正确答案(排名前三的候选答案中包含真实答案),而RSGPT和Opus-4.7各只在2个案例中成功。例如,对于一个含三氮唑结构的复杂分子,正确的合成路线是铜催化的叠氮-炔烃环加成反应(CuAAC),这是一类很独特的反应类型。SciReasoner能正确识别产品中的三氮唑环,并追溯到叠氮化物和末端炔烃这两种原料。RSGPT则保留了三氮唑环,在其他地方断键;Opus-4.7更是将环加成反应误判为叠氮化物与腈的加成,彻底走错了方向。
**七、三维分子形状识别:让AI学会用"立体眼光"找药**
第三个应用场景针对的是虚拟筛选,也就是从大量化合物中找出那些能与特定蛋白质靶点结合的候选药物。传统方法往往关注分子的二维结构(即原子之间的连接关系),但现实中,能与同一个蛋白质口袋结合的分子,往往在三维空间形状上相似,而在二维结构上可能差异很大。
研究团队测试了SciReasoner的分子嵌入向量(可以理解成模型对每个分子产生的一个数字"指纹")是否能捕捉到这种三维形状信息。具体方法是:给定一个已知能与特定靶点结合的参考分子,计算库中所有分子与它在嵌入空间中的距离,按距离排序,然后看排在最前面的那批分子是否真的对这个靶点有活性。
在DUD-E数据集(102个靶蛋白,每个靶蛋白有若干已知活性分子和大量设计好的"陷阱分子")上,SciReasoner的嵌入向量在5%富集因子(EF,衡量排名靠前的候选分子中活性分子比例相对随机基准的倍数)指标上达到了7.70,超过了此前最佳的ConfSeq方法(7.12),AUC(曲线下面积,另一个综合评估指标)也达到了0.76,与最佳方法持平。
更有趣的是定性分析。研究团队选取了三个结构完全不同的靶蛋白——ADAM17(一种金属蛋白酶)、碳酸酐酶II和环氧化酶-2,并把每个靶蛋白的活性分子投影到二维图上(使用UMAP降维,类似于把高维数据"压扁"成可视化的平面)。结果发现,三个靶蛋白的活性分子各自形成了清晰分离的聚类,而大量"陷阱分子"被推到了这些聚类之外。更说明问题的是,在同一个聚类内部的分子,它们在二维化学结构上可能差异很大,但实验测定的三维形状相似性却很高,说明SciReasoner的嵌入空间是按照三维药效团几何形状而非二维骨架来组织的。以碳酸酐酶II为例,参考分子只有一个极简的含磺酰胺基团的小片段,但与它在嵌入空间距离最近的活性分子,涵盖了环己基磺酰胺、嘧啶噻二唑磺酰胺和噻吩噻嗪酮等结构截然不同的化合物,它们共同点是都暴露出了能与碳酸酐酶活性位点锌离子结合的磺酰胺基团。
**八、晶体材料预测:从原子排列推断电子性质**
第四个应用场景是无机晶体材料的性质预测。研究团队在五个不同的材料数据库上(Materials Project、JARVIS-DFT、SNUMAT、hMOF和QMOF)进行了测试,涵盖了能带隙、生成能、弹性模量、孔径、CO?吸附量等十个不同的材料性质预测任务。
对比对象包括CGCNN(一种经典的图神经网络方法,专门为晶体性质预测设计)和LLM-Prop(一种基于大语言模型的材料性质预测方法)。SciReasoner在全部10个任务上都超过了CGCNN,在大多数任务上也超过了LLM-Prop。
研究团队还分析了模型学到的材料表示空间。通过UMAP投影,可以看到碳(C)、硅(Si)和碳化硅(SiC)三类材料在嵌入空间中形成了清晰分离的区域,体现了化学成分层面的区分能力。更细致的是,在同一种成分(比如纯硅或纯碳化硅)内部,不同晶体结构(多形体)的样本并没有堆叠在一个点,而是分散在一段连续的子空间里,并且这段子空间的排列与带隙大小形成了连续的梯度——带隙小的材料聚在一端,带隙大的聚在另一端,中间是平滑过渡。这说明模型的表示空间不仅能区分不同化学成分,还能捕捉到同一成分内部由结构差异引起的电子性质变化,而不仅仅是记住了"硅的带隙大约是1.1电子伏"这样的成分-性质统计关系。
在生成能预测的精度对比上,SciReasoner的R?值(决定系数,衡量预测值与真实值的符合程度,满分1.0)达到了0.895,带隙预测的R?也有0.785,说明预测误差不仅小,而且在各个数值范围内都是均匀分布的,没有"只对某段范围特别准"的偏差。
研究团队还展示了一个具体的推理案例——预测TiGaCo?合金的稳定性。SciReasoner的推理轨迹从识别SLICES编码中代表Fm-3m空间群的子串开始(Fm-3m是一种高对称性的面心立方结构,通常与稳定的金属间化合物相关联),接着逐个检查原子连接关系,发现Ti-Co跨晶胞边界的连接、Ti-Ga胞内连接等键合模式,最终将这种结构特征与已知的Heusler合金结构类型对应,得出"该材料结构稳定"的结论——整个过程有据可查,每一步都引用了输入的结构信息作为证据。
**九、"结构证据"到底有多重要:移除结构后会发生什么**
为了确认结构信息不只是"锦上添花"而是真正不可或缺的推理基础,研究团队做了一系列消融实验(即刻意移除某个输入成分,观察性能变化的实验)。
实验在三个领域都一致地发现:移除结构信息后,性能显著下降。以蛋白质亚细胞定位预测为例,有结构信息时准确率为0.83,移除结构后降至0.53,下降了约36%。GO细胞组分预测的Fmax从0.58降至0.45,GO分子功能预测从0.66降至0.47。在材料领域,QMOF数据库的综合预测分数从8.61降至5.71,下降了约34%。在分子相似性任务上,5%富集因子从7.70降至6.88。
更有意思的是,研究团队发现移除结构信息后,模型的推理路径也发生了根本性变化。以孔隙材料的孔径预测为例,没有结构信息时,模型只能根据化学式猜测:它依据有机配体中的碳原子数量多推测配体较大,从而猜测孔径较大,最终给出11.1埃的预测值,而真实值是1.27埃,误差接近10倍。加入结构信息后,模型识别出了单斜晶体对称性(来自SLICES的对称性子串),分析了钴原子连接到氮和氧原子的局部配位环境,以及周期性偏移向量揭示的跨晶胞连接模式,最终给出了1.14埃的预测,非常接近真实值。两个推理轨迹,一个基于成分猜测,一个基于结构分析,得到了天壤之别的结果。
蛋白质GO预测的类似对比同样直观。对一个实际上参与蛋白质修饰过程的蛋白质,没有结构信息时,模型注意到序列中有带正电荷的精氨酸和赖氨酸残基簇,以及一对可能协调金属离子的组氨酸,于是推断这可能是一个核酸酶或重组酶,预测了"DNA重组""DNA修复""应激响应"等完全错误的GO标签。加入结构信息后,模型识别出连续的V和L字母代表的α螺旋区段,以及交替出现的D、P字母代表的转角区域,判断这是一个典型的α/β混合折叠,并结合序列中甘氨酸富集区域以及ATP结合相关motif,推断出这是一个参与磷酸基团转移的代谢酶,预测了正确的"蛋白质修饰过程""肽酰赖氨酸修饰"等标签。
**十、人类专家怎么看SciReasoner的推理质量**
光靠自动化指标评估AI的推理质量有一定局限性——指标可能被钻空子,而真正的推理质量需要领域专家来判断。研究团队为此组织了一次双盲人类专家评估实验。
评估覆盖三类任务(蛋白质GO预测、晶体材料性质预测、逆合成规划),邀请了该领域的专业研究者参与。评估者对两个模型的身份完全不知情(即双盲),只能看到输入、两段匿名的推理轨迹和最终答案,以及一份包含真实答案相关信息的只读参考表。评估者需要在五个维度上对每段推理轨迹打分(1到10分):证据锚定(推理是否引用了真实存在于输入中的信息)、领域合理性(科学推断是否符合真实)、目标区间对齐(结论是否落在正确的科学区间内)、推理连贯性(推理链条是否完整自洽)和反幻觉能力(是否捏造了不存在的内容),此外还有一个整体对比选项。
**十一、跨86个基准测试的全面评估**
除了上述深度分析的四个场景,研究团队还在横跨生物学、化学和材料科学三大领域共86个基准测试上进行了全面评估,与Opus-4.7、GPT-5.5、Kimi-K2.6和DeepSeek-V4-Pro四个前沿通用语言模型,以及各领域最佳专业模型进行了比较。
在生物学任务方面,SciReasoner表现全面。蛋白质荧光预测的Spearman相关系数从通用模型最高的0.50提升到了0.77;蛋白质稳定性预测从0.36提升至0.61;RNA同种型使用预测R?从0.09提升至0.86;平均核糖体负载预测R?达到0.60;RNA蛋白质相互作用预测的MCC从-0.44(DeepSeek-V4-Pro甚至是负相关)提升至0.81;转录因子结合预测MCC达到0.64;基因功能文字描述的ROUGE-L分数达到0.80;酶催化活性描述达到0.70;亚细胞定位分类准确率达到0.88,超过了专业模型ESM2的0.84;蛋白质功能引导设计的标准化SW评分达到0.94。
在化学任务方面,SciReasoner在化学信息提取、分子名称转换、分子描述生成、反应预测和逆合成等多类任务上均领先。正向合成预测精确匹配率0.73,正向反应产物预测0.98,逆合成分子的精确匹配率0.67,小分子溶解度预测RMSE为1.03,脂溶性预测RMSE为0.80,分子分类任务(血脑屏障穿透性、临床毒性、HIV活性、副作用)的准确率分别达到0.84、0.95、0.92和0.74,均超过通用模型。
在材料科学方面,SciReasoner在全部10个性质预测任务上均超过CGCNN,在9个任务上超过LLM-Prop,在JARVIS-QETB数据集上的MAD/MAE(预测误差相对于数据离散度的比值,越大越好)甚至达到了108.98,远超通用模型的0.73至0.88。
横跨86个任务,SciReasoner在67个任务上达到了当前最佳水平,在33个有专业模型对比的任务中,有26个任务上匹配或超过了相应的专业模型。
说到底,SciReasoner做的事情,可以用一句话来概括:它是第一个能在生物学、化学和材料科学这三个领域同时做到"既算得准、又说得清"的AI系统。"算得准"意味着它的预测精度不亚于甚至超越了专门为某类任务设计的专业工具;"说得清"意味着它的每一个结论都附带着可以被人类专家检验的推理轨迹,而且这些轨迹里引用的都是真实的结构片段,不是凭空捏造的。
这种能力对科学研究的意义不仅仅在于提升效率。当AI能展示推理过程时,研究人员就能判断它的预测是恰好猜对了还是真正理解了背后的科学原理,就能发现推理链条中的错误或疏漏,就能把AI的分析当作一个可以追究责任的科学建议,而不是一个必须无条件接受或拒绝的黑盒输出。当然,SciReasoner目前采用的结构编码方案(Foldseek的3Di序列、ConfSeq和SLICES)本身仍是对真实三维结构的一种近似表示,不可避免地存在信息压缩;此外,推理轨迹中引用的结构证据虽然真实,但这些证据是否真的是因果性的(即模型真的因为读到了这段结构才做出了这个判断),还是仅仅是后置解释,仍然是一个值得深入研究的问题。
如果读到这里,你对SciReasoner背后的技术细节意犹未尽,可以直接在arXiv上搜索编号2607.07708,阅读原始论文获取更完整的方法描述和实验数据。
Q&A
Q1:SciReasoner是什么类型的AI模型,和ChatGPT有什么不同?
A:SciReasoner是一个专为科学研究设计的多模态基础模型,由上海人工智能实验室等机构联合开发。与ChatGPT等通用语言模型的核心区别在于,SciReasoner能直接处理蛋白质三维结构、分子立体构型和晶体周期性排列等原始科学结构数据,而不是把这些信息先转换成文字描述再处理。更重要的是,SciReasoner会生成带有结构证据的推理轨迹,每一步结论都引用了具体的结构片段,可以被科学家逐一核查,而不是给出一个无法追溯的答案。
Q2:SciReasoner在逆合成规划中的精确匹配率0.72是什么概念,比之前好了多少?
A:逆合成规划中的精确匹配率0.72意味着,给定一个目标分子,SciReasoner有72%的概率能准确预测出正确的原料分子组合,且要求预测结果与标准答案完全一致。此前最佳的专业逆合成模型RSGPT的精确匹配率是0.63,SciReasoner提升了约14%。通用大语言模型Opus-4.7在同样测试上只有0.48。这个提升对药物合成路线设计具有实际价值,因为逆合成建议的准确性直接影响化学家选择合成路线的效率。
Q3:SciReasoner的推理轨迹真的可靠吗,会不会捏造不存在的结构证据?
A:研究团队通过双盲人类专家评估专门检验了这一点。评估者在"反幻觉"维度上给SciReasoner平均打分8.8分(满分10分),而对比模型DeepSeek-V4-Pro只获得4.6分。评估规则要求评估者检查推理轨迹中引用的每一个具体结构片段、原子索引、化学基团或反应机制是否真实存在于输入数据中,若引用了输入中不存在的内容,则判定为"幻觉"并大幅扣分。结果显示,SciReasoner的推理轨迹在证据真实性上具有明显优势,但这不代表其推理完全没有瑕疵,仍需专业研究人员对重要结论进行独立验证。
热门跟贴