31.5%,放在手机跑分圈,这成绩根本不够看。可放到真实科研里,这反而有点吓人。
因为这次测的不是“会不会背答案”,也不是“能不能把代码跑通”,而是把AI直接扔进最脏、最绕、最像导师临时甩锅的那种科研现场:129道题,10个主领域、21个细分子域,题目横跨基因组学、定量生物学和转化医学,很多题人类专家做一题就得20到40小时。OpenAI给它起的名字也很直白,GeneBench-Pro。
这套东西我觉得真正狠的地方,不是难,而是“脏”。
测序今天已经很便宜了,一个样本几十美元、几小时出数据,行业瓶颈早就不是采不到数据,而是你拿到一堆混着批次效应、环境RNA污染、伪基因干扰和假阳性信号的原始结果后,到底敢不敢拍板。OpenAI这次就是专门考这个:数据没有说明书,模型得自己判断哪些是生物学效应,哪些只是噪声,然后决定后面整条分析链怎么走。
说白了,这已经不是“答题”,而是“做判断”。
题库本身也不是随便拼出来的。GeneBench-Pro一共129题,相比2026年4月那版103题的初代GeneBench,新增29题、删掉3题,剩下重叠的100题里还有54题被重做;82题还拉了外部领域专家审核,另外公开了10个完整案例,50题交给Artificial Analysis做第三方测试,摆明了不想让它变成自家关起门来玩的跑分。
这一点很关键。
因为你会发现,同样是GPT家族,换到这个更狠的新场子,分数直接变脸。OpenAI公开的结果里,GPT-5.6 Sol在最高推理强度下是28.7%,开Pro后到31.5%;Claude Opus 4.8是16.0%,Gemini 3.5 Flash 8.1%,Gemini 3.1 Pro 3.1%,GLM 5.2 4.6%,DeepSeek V4 Pro 2.4%,Grok 4.3 1.5%。而老版GeneBench里,GPT-5.5 Pro当时能到33.2%,现在到GeneBench-Pro只剩20.5%。不是模型突然退步,是及格线直接被抬高了。
如果只看31.5%,很容易得出一句“也不过如此”。但我个人真不这么看。
这类题最折磨人的地方,是前面任何一个判断点选错,后面基本全偏。OpenAI在公告和论文里反复提了同一个结论:现在的模型经常能看出“这里数据有问题”“这里质控不对”,但它就是不会顺着这个发现把整条分析路线改掉。它能 noticing,却不一定会 acting。
这就有意思了。
以前我们总觉得AI最大的短板是“不懂”。现在GeneBench-Pro掀开的底牌是:它有时候其实懂,至少局部懂,但还不够稳,不够敢推翻自己前面的路径。这个味道已经很像真人研究员了——看见异常,嘴上说一句“有点不对”,手上还是继续往下做。
从行业坐标看,这比单纯提升知识问答分数要重要得多。因为真正值钱的,不是它能不能背出一个靶点名,而是它能不能在一堆互相打架的信号里,帮你少走弯路。
更现实的是成本账。按官方给的口径,这些题人类专家通常要20到40小时,按每小时200美元算,一题就是几千美元的人力;而AI一次推理成本只是几美元级别。它现在当然还替代不了研究员,但只要能把前期筛查、路径试探、异常定位这部分自动化一点点,药物研发、靶点验证、分子分型这些地方,效率就已经完全不是一个量级了。
所以我对这事的判断很直接:31.5%不是“AI在科研里还早”,而是“AI已经摸到门槛,但离真正能独立扛活,还差最后那口气”。
这口气,不在算力,不在token,不在会不会调库,而在会不会因为一个异常信号,真的改主意。
如果你关心的是AI什么时候开始真正吃进高价值脑力工作,那GeneBench-Pro比任何一场发布会都更有参考价值。它没把AI吹成科学家,但它第一次把“科研助理”这件事,测得像回事了。
这才是重点。
热门跟贴