过去三年,AI行业正在发生一场静默的范式转移。从2022年起,每年都有一块原本由人类完成的AI训练环节,被模型自己生成的版本取代。这个过程并不均匀,但方向清晰:人类在AI训练管线中的角色,正被一步步替换为“模拟版本”。

这种替换的逻辑可以用一组数字概括:质量比人类版本差10%,成本却便宜100倍,速度快10000倍。当差距只有10%时,成本与速度的优势足以让前沿实验室义无反顾地转向模拟方案。

打开网易新闻 查看精彩图片

第一个被替换的环节:裁判

最先被“合成化”的环节出乎很多人意料——是评判者。InstructGPT确立了如今的标准做法:一次性收集人类偏好数据,训练一个奖励模型,之后让策略模型对着这个模型优化,而不是直接对着人类优化。从策略模型的角度看,给它打分发放“奖励”的已经是一个LLM。

Constitutional AI更进一步,让AI依据一套原则自我批评(即RLAIF)。后续研究显示,AI反馈能以极低的成本达到接近人类反馈的效果。等到LLM-as-judge成为默认评估方法(MT-Bench、AlpacaEval),整个审批机制——奖励、批评、评估——已经全部由模型来评判模型。

语料库:从“人类不可替代的输入”到模型代写

微软的Phi系列用标题直接点明论点:“教科书就是一切”。一个用LLM合成的教科书质量数据训练的小模型,表现远超其参数量应有的水平,phi-1.5证实这不是偶然。苹果的WRAP把这个思路推广:不只是生成数据,而是用LLM重写整个网络,预训练效率提升约3倍。

这条路线随后走向工业化——NVIDIA的Nemotron-4 340B把宽松许可的合成数据生成管线作为核心卖点发布。到2025年,推理轨迹语料库(由强推理模型生成的思维链)已成为预训练和中期训练的标准配料。那个被认为“不可压缩的人类输入”的语料库,如今大部分由模型自己书写。

从模仿到蒸馏:训练数据的全面合成

ChatGPT API开放几周后,斯坦福的Alpaca就证明:用GPT生成的指令做一次600美元的微调,就能克隆前沿模型的大部分行为。Vicuna用共享对话实现类似效果,Orca则用丰富的教师解释而非简单答案来训练。这项技术从模仿进化为正规训练纪律——on-policy广义知识蒸馏解决了训练与推理不匹配的问题——并在DeepSeek-R1发布时达到文化顶峰。

这条演进路径指向一个结论:AI行业正在用“足够好”的模拟替代“完美”的人类输入,换取数量级的成本与速度优势。10%的差距,在100倍的价差面前,已经不再是障碍。