新智元报道
AI圈迎来一场「大地震」!
今早,谷歌传奇大佬Jeff Dean一纸公告,告别效力了27年的谷歌。
几乎同一时间,他与三位顶尖老友一起打造的新公司——Discovery Loop,也正式浮出水面。
从名字就能看出,他们押注的,正是当下AI领域最火热的方向RSI(递归自我改进)。
让AI持续自我迭代、自我进化,并自动攻克机器学习、科学研究和工程技术领域的重要难题。
Discovery Loop所代表的,是一条越来越清晰的路线:用AI加速AI。
未来,AI将彻底告别单纯的「问答模式」,全盘接管「提出假设➔执行实验➔验证结论」的完整科研闭环。
而就在今天,中国队也下场了。
BigBang-V1首秀
35B击败DeepSeek V4
由上海交通大学人工智能学院、深势科技、上海算法创新研究院组成的「无尽前沿团队」,已经把这条循环跑完了一整圈。
他们交出的,是第一个通过「原生RSI」方式,训练出来的全新基座大模型——BigBang-V1,总参数35B。
主页:https://endlessfrontier.tech/
论文:https://endlessfrontier.tech/assets/paper.pdf
模型:https://huggingface.co/endless-frontier
以可验证前沿任务为牵引,它用了100%纯AI合成的数据,便实现了性能大爆炸。
在35B级别的测评中,BigBang-V1一口气狂揽十项第一。
在OpenAI提出的高难度科学基准FrontierScience Research上,它拿到46.2分,击败了DeepSeek V4 Pro。
35B硬刚1.6T,在45倍的体量悬殊之下,BigBang-V1完美诠释了什么是真正的「以小博大」。
它在各大高难度榜单的战绩,也同样堪称硬核:
在Humanity's Last Exam (人类最后考试)基准上,BigBang斩获50.3分,击败V4 Pro,堪比Gemini 3.1 Pro。
这是一个测试大模型综合推理能力的基准,由Scale AI在Nature正刊上提出。
在OpenAI提出的PaperBench (Code-Dev)上,BigBang跑出了53.6,V4 Pro仅为50.4。它主要考的是大模型复现AI学术论文的能力。
另一个OpenAI提出,考察模型自主完成AI工程能力的基准MLE-Bench (Lite)上,BigBang亦交出了59.1分的亮眼答卷。
不仅如此,它还在更高难度的BioMysteryBench Human-Difficult上,取得了15.7分,V4 Pro为13.7分。
这是Anthropic迄今推出的唯一一项基准测试,主要考察大模型解决生物信息学研究问题的能力——
给模型一堆带噪声的测序数据,要它分析出一个精确、且符合评分标准的生物学结论。
技术报告里的几个具体案例,更能看清BigBang的优势在哪。
第一个现场:找病毒。
就以BioMysteryBench评测中,一道生物学题目为例——
三份人体肠道类器官的测序原始数据摆在面前,模型要判断感染的是哪种RNA病毒。
BigBang连跑三次,答案完全一致:诺如病毒GII.4,3/3全对。
DeepSeek V4 Flash呢?三次给了三种毫不相干的病毒,而且没一个沾边的。
第二个现场:复现论文,还挑出了错。
这次换了个活儿——复现。照着一篇论文,把它的方法原样实现出来。
结果BigBang读到一半就觉得不对劲。跑了几个测试一看,问题出在论文自己身上:核心设定有矛盾。
有个关键量被固定住了,这么一来,论文说能做到的「子集不断缩小」就根本发生不了。
于是,BigBang直接动手改了这处设计,让子集大小能真正变化,还顺带修好了一个梯度中断的问题。复现最后拿到0.7657。
相比之下,DeepSeek V4 Flash只做了语法检查,看代码能启动就交卷了,实际一次都没运行。最终结果只有0.3053。
把多个开源模型串成一条抗体设计流水线
单独的题看得差不多了。这次咱们上点狠的,直接甩给它一个真活儿:设计一款抗体。
BigBang的解法,是把它拆成一条流水线,让好几个开源模型接力干。
首先,用开源的蛋白质设计模型生成一批抗体候选,按规则筛掉一批。
然后把留下的交给AlphaFold,预测抗体与靶标的复合物结构,再用结构置信度和界面指标,评估结构是否稳定、结合是否合理。不达标的就直接淘汰,或者退回上一步重做。
过了AlphaFold这关,候选还要进一个开源的物理打分器,评估界面能量、原子冲突这些指标。
关键在于,这两步用的是两套完全独立的计算方法。只有它们的结论对得上,候选才留得下来。
当然话得说回来,这些还只是算出来的候选,不代表抗体真能用,最后还得靠实验去验。
设计出来的样例分子
看到这儿,你一定会忍不住追问:一个仅有35B参数的模型,凭什么拥有如此强悍的战斗力?
答案,就藏在它背后的「原生RSI」训练方式中。
令人震撼的是,BigBang使用的各学科前沿科研的数据,100%由AI合成。
题目是AI出的,解法是AI跑的,答案是AI自己验的,就连「这批数据该怎么造」,也是AI自己完成的。
这才是BigBang,真正想引爆的东西。
一个RSI闭环,跑通了
具体来说,BigBang搭出来的是,一条能持续修改自己生产策略的合成数据流水线。
AlphaGo学的是人类棋谱,AlphaZero把棋谱扔了,自己跟自己下。
BigBang这套数据引擎,是同一个思路换了个赛道——
这一次,自我博弈的内容不是下棋,是出题和判卷。
这套引擎由两类Agent组成,外面还套着一层真实考试。
Generator Agent负责出题,也负责改造出题方法。
它会直接修改、运行和调试数据合成程序,根据模型当前的能力缺口调整任务与验证规则:
题目该从哪些科学领域来
问题需要多长的推理链
该用搜索、计算、代码还是模拟工具
最终答案怎么验证
哪些样本留下、哪些淘汰
哪些生成策略已经证明失败、下一轮别再试
每跑完一轮,它还会把这次改了什么、为什么改、结果如何、哪里失败了记下来。下一轮的探索是踩在上一轮的经验上往前走的,不是从零开始。
Critic Agent负责审题,主要站在对面「挑刺」。
它的审查分两层。第一层看格式、工具执行、数据完整性这些硬伤;第二层才进正题——
这道题对不对、能不能验、够不够难、跟已有的重不重,以及最关键的,训了到底有没有用。不合格的的打回重做,过了的进合成数据集。
然而如果到这儿就停了,那我们得到的只会是一个转得很快的内循环。并且还有个致命隐患:出题的会讨好判卷的。
有些题看着复杂,其实只是把表面难度堆上去;有些样本Critic给了高分,模型练完却什么也没长;甚至有些题会钻验证器的漏洞,骗到虚假的正反馈。
对此,BigBang的解法是在外面再套上一层:用真实训练结果,来考核判卷的那一个。
具体来说,要是Critic打了高分、模型练完却没长本事,那说明Critic判偏了。系统拿真实结果回头校准它,再调Generator下一轮的选题和难度。
于是,一整套系统闭环合成,飞轮转起来了:
真实任务暴露缺口 → 造题筛题 → 合成数据训新模型 → 回真实任务受检 → 用结果校准下一轮。
团队给它起了个名,数据层的递归自我改进(RSI)。
为什么是科学?
科学是人类系统认识宇宙和世界的基本方式,本身就是一片无尽的前沿。
也正因如此,它成了通用智能最好的训练场——最难,也最普适。
具体到BigBang,之所以选科学当练兵场,是看中它同时占着「让模型持续变强」的两个关键条件:前沿,和可验证。
前沿,是说这些题够难,难到位于知识和能力的边界,有的压根没有已知最优解。它也不像静态题库刷完就没,新理论、新工具一直在冒,前沿会源源不断长出新题。
可验证,是说答案还能被客观检查。形式化方法、代码执行、数值计算、仿真器、实验反馈、领域工具,都行。
更难得的是,科学天生就把搜索、阅读、提假设、数学推导、写代码、调工具全揉进了一道题里。
所以在这支队伍眼里,科学早已超出「一个知识领域」的范畴。
它是一门通往通用智能的综合课;只要科学的前沿还在延伸,模型能学的东西就没有尽头,智能也就一直有向上的空间。
AI迭代AI,奇点已现
最终,BigBang-V1用自己的诞生,证明了Scaling的破局点不仅仅在于参数与算力的堆叠。
无需扩大基础模型参数量,仅通过革新训练任务的生成范式,它便在科学研究、长程探索、代码生成、工具调用上,获得了全面的性能增益。
但跟更重要的是,AI每一轮能力提升,都在给下一轮制造新的燃料。
AI生成并求解科学任务,科学任务反过来训练出更强的AI,更强的AI再回到下一轮,继续改进这套数据系统。
「无尽前沿」团队把这个「循环」凝练为一句话:
AI advancing science, and science advancing AI.
这支由上海交大人工智能学院首席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,其野心并未止步于此。
在这句箴言背后,他们真正指向的,是一个更为遥远的「星辰大海」。
他们试图打造的,是一个在智能与理性判断上,逐步逼近「造物主」的终极模型。
它能以冷静、客观地洞悉万事万物的机缘、机理、规律与发展变化,然后严格按照事物本身的规律去回答、去执行、去判断和预测。
这也解释了,为什么这条路必须建在「科学」上。
因此,追寻AGI与追寻科学,本质上是同一件事:向造物主致敬。而无限逼近造物主的意义,说到底就是无限最优化。
1945年,范内瓦·布什在《科学:无尽的前沿》里,回答的是一个国家如何靠持续投入基础科学,换来此后几十年的增长。
81年后,一支以「无尽前沿」为名的中国团队,将同样的命题延展至AI时代——
当科学前沿本身,化作模型可以无尽开采的训练富矿,人类逐题生产训练数据的那个时代,是不是正在结束?
BigBang-V1大概只是这条新曲线上的第一个点。但这条曲线,已经开始爬坡了。
编辑:摩西 桃子
热门跟贴