编辑|+0、杨文
AI 开始参与造 AI,下一步学什么成了新问题。
Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。
行业的注意力也开始转向研究流程本身。昨天,在谷歌效力 27 年的技术元老 Jeff Dean 官宣离职,拉着 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 三位老伙计共同创办 Discovery Loop。而这家公司干的,就是自动化科学与工程中的完整实验循环,让 AI 提出实验、完成实现、运行评估,再根据结果调整下一步方向。
那么问题来了,当模型越来越擅长解决问题,下一批真正有价值、足够困难的问题该由谁提出?这些问题的答案又该如何可靠验证?
来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让 AI 参与创建、筛选和迭代自己的训练任务,并由此发布科研大模型 BigBang-V1
- 模型:https://huggingface.co/endless-frontier/BigBang-v1
- 项目主页:https://endlessfrontier.tech/
- 论文标题:BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks
- 完整技术报告:https://endlessfrontier.tech/assets/paper.pdf
BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,在后训练阶段使用了完全由 AI 合成的数据。实验结果显示,在所选 35B 规模模型中,BigBang-V1 在 10 项评测上取得最高已报告分数,并在若干高难度任务上达到或超过部分更大规模的前沿模型。
BigBang-V1 与代表性闭源、开源前沿模型及 35B 参数规模模型在长程搜索、编程、科学研究和 AI 研究基准上的对比。“-” 表示相关分数尚未公开或未经测试。
又一次「小模型挑战大模型」的叙事?并非如此,BigBang-V1 的真正亮点是它背后的数据生产方式。
在传统流程中,人类专家确定方向、设计问题、准备答案并检查结果,模型负责学习已经整理好的数据。BigBang 则试图把其中更多工作交给 AI,它不仅生成问题和答案,还参与修改数据生产程序、调用工具完成任务、检查候选结果,并根据数据是否切实提升了模型能力调整下一轮合成策略。
过去,AI 主要是被出题、被训练、被考试,BigBang-V1 则让 AI 开始参与决定下一代模型应该学习什么
模型越来越强,人类开始出不动题了
Scaling Law 大家已经耳熟能详,增加参数、投入更多算力、收集更多数据,模型能力通常也会随规模增长而提升。
过去几轮模型能力的跃迁,几乎都可以从参数、算力和数据的扩张中找到解释。久而久之,「更大」也就成了「更强」的同义词。
但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。
尤其当模型开始接近人类专家在部分任务上的水平,下一批真正能让模型继续进步的训练任务,要从哪里来
这和「互联网上还有多少文本」并不是一回事。
网上的数据当然还有很多,但具备训练价值的新任务未必充足。模型已经反复见过的知识,再学十遍也难以扩展能力边界。真正困难的是,如何持续提出模型还不会、又值得学习的问题。
这类问题通常需要专业研究人员来设计、求解和验证。GPU 可以采购,专家时间却很难按卡扩容。大模型几天就能消耗掉海量数据,人类专家却无法突然进入倍速模式。哪怕一天喝三杯咖啡,也很难跟上计算集群的数据胃口。
更准确地说,模型缺的不只是题,而是「题目加反馈」。
一道题足够难却无法判断答案对错,很难形成稳定的训练信号;一道题容易验证却低于模型当前能力水平,训练价值同样有限。
真正适合持续训练的任务,需要同时满足两个条件:足够前沿,也能够验证。前沿性决定模型能否学到新东西,可验证性决定它学到的是不是对的。
BigBang 把科学研究选作了这两个条件的交汇点。
科学会不断产生新问题,同时提供形式化证明、程序执行、数值计算、模拟器、数据库、实验反馈和领域规则等多种验证手段。模型的答案可以直接放进工具里跑一遍,不必只靠另一个模型来评判。
更重要的是,解决一个完整的科学问题,往往需要搜索资料、判断证据、提出假设、编写代码、调用工具、分析结果,并在失败后调整路线。科学因此成为训练通用问题解决能力的综合课程。
但模型能力会不断变化,固定题库迟早会过期。上一轮还很困难的问题,训练之后可能迅速变成送分题。BigBang 真正要解决的,不只是「如何生成更多科学数据」,还得是如何让训练任务的生产系统,随着模型能力一起变化
BigBang 如何让「造题程序」自己进化?
BigBang 的技术框架包含内外两层循环。内层持续改进合成数据,外层验证这些数据能否真正提升模型
内层循环由 Generator Agent 和 Critic Agent 组成。前者持续生成并求解候选任务,后者负责对抗式审查。通过审查的样本进入训练数据池,存在缺陷的样本会被修改或淘汰。Critic 给出的反馈还会影响下一轮生成策略。
BigBang 整体框架。Generator Agent 持续更新数据合成策略并构造任务,Critic Agent 执行质量评估和约束检查,经过筛选的合成数据用于后训练 BigBang-V1。
Generator Agent并非只根据提示词批量生成题目,它以代码 Agent 的形式工作,可以直接修改、执行和调试数据合成程序,在任务构造、工具使用、答案验证和样本筛选等环节搜索更好的策略。
每轮实验结束后,生成器会记录修改动机、结果和失败原因,供后续轮次继承。系统优化的对象由单条样本扩展至整套数据生产程序。
Critic Agent承担快速评估。
理想情况下,每改变一次合成策略,团队都可以重新训练模型,再观察下游能力是否提高。这样的实验成本很高,反馈周期也很长。Critic 先估计一批数据的训练价值,为 Generator 提供更密集的优化信号。
它的审查分为两层。第一层检查基本约束,包括推理轨迹是否保留足够信息、工具调用是否有效、数据格式是否完整,以及样本能否被训练与执行系统正确解析。第二层检查更高阶的质量,包括关键结论有没有证据、不同步骤是否存在矛盾、最终答案能否客观验证,以及任务是否需要非平凡的研究和推理。
这套内层循环可以持续改进合成策略,却仍然存在一个风险。Critic 可能把「看起来很难」误判成「能够帮助模型进步」。一个任务拥有复杂叙述和很长的工具轨迹,不代表它具备真实训练价值。
BigBang 为此加入外层循环,用于校准这种偏差。
系统会选择不同版本的数据生产管线,使用其生成的数据分别训练模型,再将模型放到留出的真实研究任务中评测。
Meta-Critic比较两种信号。第一种是 Critic 对数据价值的预判,第二种是模型训练后的实际能力变化。如果一批数据得到很高评价,模型却没有在真实任务上进步,Critic 的标准和 Generator 的策略都需要调整。下一轮数据的领域分布、难度和能力要求也会重新配置。
BigBang 的两层共同演化框架。内部 Generator–Critic 循环负责快速生成和筛选可验证数据;外部真实任务评测检验数据效用,并反向校准 Critic 和下一轮合成策略。
如此一来就形成了一个完整飞轮。真实任务暴露能力缺口,Generator 生产针对性问题,Critic 过滤低价值样本,合成数据用于训练新模型,模型再回到真实任务接受检验。评测结果继续改变下一批数据的生产方式。
35B 跨越规模,BigBang 学到的不只是科学
实验结果怎么样呢?
BigBang-V1 后训练阶段使用约一万条 AI 合成数据。在 11 项评测中,它有 10 项超过基础模型,并在多项高难度任务上进入了更大模型所在的能力区间。
在 FrontierScience Research 上,BigBang-V1 获得 46.2 分,DeepSeek V4 Pro Preview 为 40.7 分;在 Humanity’s Last Exam 上,前者为 50.3 分,后者为 48.2 分;在 BioMysteryBench Human-Difficult 和 PaperBench(Code-Dev)上,BigBang-V1 也取得了更高成绩。
BigBang-V1 在涵盖长程搜索、软件工程、科学研究和 AI 研究的八项代表性基准上均取得优异表现。在选取的 35B 模型中,BigBang-V1 在全部八项基准上取得最高报告分数;在 FrontierScience Research、Humanity’s Last Exam、PaperBench(Code-Dev)和 BioMysteryBench-HD 上,它甚至超过了 DeepSeek V4 Pro Preview(1.6T)。
这些任务考察它能否完成检索、推理、代码执行和结果验证等连续工作。
BigBang-V1 的实验结果表明,在不扩大基础模型规模的情况下,改变后训练任务的生产方式,也可能明显拓展模型能力
而且,这种提升没有停留在科学评测中。
在开放网络长程检索任务 BrowseComp 上,BigBang-V1 取得 76.5 分;在真实软件工程评测 SWE-Bench Pro 上,它取得 54.2 分,均较基础模型明显提高。
如果训练只是让模型记住了更多科学知识,收益理应主要出现在科研任务中。搜索和代码能力同步增长,说明模型学到的更可能是一套跨领域的问题解决流程:寻找证据、提出假设、调用工具、检查结果,并根据失败调整路线。
团队给出的两个案例,更具体地展示了这种变化。
在 BioMysteryBench 的病毒识别任务中,模型需要分析三份肠道类器官样本的 FASTQ 文件,判断感染的 RNA 病毒。BigBang-V1 三次运行都将答案收敛到 Norovirus GII.4 或 Norovirus;作为对比,DeepSeek V4 Flash Preview 三次给出了三个不同的病毒类别。
这里的关键在于模型能否从噪声数据中建立稳定的证据链,并多次收敛到同一个可复查结论。
另一个案例是旋量范数椭圆积分任务。题目要求模型精确计算一个复杂的椭圆积分,明确禁止用数值积分或截断级数代替解析答案。
BigBang-V1 先找到一份公开的证明纲要,随后核验其中涉及的 Landen 变换、边界条件、参数变换和特殊值关系,最终给出只包含 Gamma 函数的闭式结果,并形成一条完整的推导与验证链。
DeepSeek V4 Pro Preview 也得到了正确结果,并通过最高约 200 位精度的数值计算确认其一致性。不过,它没有完成从原始积分到最终结果的解析推导,提交程序仍然依赖现成的椭圆积分函数。
旋量范数椭圆积分任务上的推理轨迹对比。两个模型都给出了正确结果。BigBang-V1 进一步完成了关键中间步骤的核验和完整解析推导;DeepSeek V4 Pro Preview 却没有完成从原始积分到特殊值的解析推导。
两者答案都正确,差距集中在证明过程的完整性和可审计性。对于高难度科学任务,模型既要找到结果,也要说明结果如何得到、关键步骤能否成立。
病毒识别和椭圆积分分属生物分析与符号数学两个领域,却体现了相通的能力,就是把复杂问题拆成可验证的步骤,从噪声中提取有效证据,并在检查后持续修正路径。
这也解释了科学训练为什么能够迁移到搜索和代码任务:模型在学习科学知识的同时,也反复练习了一套可以用于复杂问题的方法。
BigBang 进一步把合成数据从一次性样本,变成了一套能够持续调整策略的数据生产系统。
数据层自我进化,离完整 RSI 还有多远?
让 AI 参与训练数据生产,BigBang 并非先例。
Absolute Zero 让模型自主提出并解决可由代码执行器验证的数学与编程任务;Google DeepMind 的 AlphaEvolve 利用大模型生成程序,再通过自动评估器演化候选方案。
BigBang 的不同在于,将任务生成程序、任务分布和评价标准共同纳入优化范围,并用真实科研任务上的训练收益校准合成管线。优化对象由单个答案或程序,扩展至训练模型所需的课程系统。论文将其称为「数据层面的早期递归自我改进」。
完整 RSI 通常意味着 AI 能够自主改进研发能力,训练更强的继任模型,再由新模型推动下一轮升级。BigBang 目前展示的是数据管线与模型能力的共同演化,是这一路径上阶段性的可执行方案。
过去的 Scaling Law 主要关注参数、数据量和计算量,现在 BigBang 又提出了另一个值得关注的维度,即数据引擎提升自身任务生成与验证能力的速度。
模型越来越擅长回答已有问题后,竞争将继续深入问题的生产端。谁能持续找到下一道值得学习、足够困难、又能可靠验证的题,谁就更有机会把模型能力的增长延续下去。
热门跟贴