我最近看到 X 上关于 AI 蒸馏(Distillation)流传着不少误解。
这些观点通常来自两个阵营:一方把它描述成一场“模型劫案”,另一方则认为“根本没什么值得关注的”。
我这里不对任何一方的具体行为发表评论,只是纠正一些关于蒸馏的常见误区。
误区一:“蒸馏就是偷走一个模型”
蒸馏是一种训练方法。
在大语言模型(LLM)领域,学生模型(student)可以从教师模型(teacher)的回答、token 概率、排序结果、偏好信息或判断结果中学习。
这种机制可以用于同一家实验室内部、不同机构之间基于授权或合同合作,以及未经授权的情况下使用。
蒸馏技术已经存在十多年,最初被广泛用于将大型系统的能力压缩到更小、更便宜的模型中。
如今,各大实验室都会使用蒸馏以及相关的合成数据技术,来构建成本更低或更专业化的 AI 模型。
还有一个更微妙的现实是,随着越来越多互联网内容由 AI 生成或编辑,新一代模型越来越多地训练于上一代模型产生的输出之上。
这严格来说并不属于技术意义上的“知识蒸馏”(knowledge distillation),但它确实形成了一种广泛存在的“模型之间能力迁移”,即使没有明确的教师-学生训练流程。
因此,“蒸馏”只能说明能力可能通过某种方式发生了转移。
它本身并不能证明是否有人进行了模型窃取。
误区二:“几百万次对话太少,不可能产生影响”
单纯从数据量来看,一些蒸馏行为确实看起来规模太小,似乎不足以产生影响。
假设每次对话包含 1000~4000 个 token、1600 万次对话,那么总量大约是160 亿~640 亿 token。
相比公开资料中的前沿模型训练规模,例如 Llama 3 405B 使用超过 15 万亿 token,这只占约 0.1%~0.4%。
但训练过程并不是把所有数据均匀混合在一起的一锅“汤”。
小规模数据在某些阶段可能拥有极高杠杆作用。
第一,后期训练阶段
在退火(annealing)阶段以及针对性的中期训练阶段,部分数据会被刻意提高权重,而不是简单均匀混入整个训练过程。
例如,在 Meta 对 Llama 3 的数据质量实验中一个 8B 模型进行了 400 亿 token 的退火训练,其中候选高质量数据占训练混合比例的 30%。
Meta 报告显示, GSM8K 数学测试提升 24.0%,MATH 测试提升 6.4%。
不过,在 405B 大模型上,收益几乎可以忽略。
这说明小规模高质量数据确实可能有效,但这种效果并不会随着模型规模线性扩大。
第二,强化学习启动阶段(RL bootstrapping)
DeepSeek-R1 在第一次面向推理能力的强化学习阶段之前,使用了数千条冷启动样本。
但简单说“强化学习完成了一切”是不准确的。
完整流程后来还加入约 80 万条监督微调样本,及另一阶段强化学习。
同时,它的伴随模型 R1-Zero 展示了即使没有监督冷启动数据,仅靠强化学习,也可以涌现出较强推理能力。
第三,训练评估器(judge)
教师模型并不一定直接提供训练文本。
它可以给答案打分、对多个答案排序,及评价网页质量。
这些标签随后可以训练奖励模型、分类器、数据过滤器。
这些系统又会影响规模大得多的数据。
也就是说,迁移的不一定是文本,而可能是判断标准、偏好和品味。
所以现实情况是,小规模数据如果处于正确的位置,可能成为整个训练流程中的关键变量。
误区三:“从模型输出可以看出来,学生模型会暴露教师模型”
这一点很难成立。
一些明显证据,例如模型直接说“我是某某公司的模型”,在经过改写、混合、转换成评分信号之后,很容易消失。
一个成熟的训练流程可能会先用本地模型重新表达教师模型回答,将数据稀释到更大的混合数据集中,或者只把教师模型用于评分,而完全不保留原始文本。
目前我也没有看到任何已经在生产环境部署、并且被证明能够在完整训练流程中存活的模型输出水印技术。
误区四:“他们正在用大量采集的模型输出填充训练数据”
预训练数据规模通常是万亿 token 级别。万亿 token 规模的合成数据集,通常不是通过调用某个模型 API 填满整个训练过程。
更常见的方法是,利用中等规模模型,对开放互联网数据进行转换。
例如NVIDIA 的 Nemotron 项目将 Common Crawl 转换成一个包含6.3 万亿 token、其中 1.9 万亿 token 为合成生成内容的数据集。
它使用 Mistral NeMo 12B 进行大规模生成,包括Wikipedia 风格改写、问答生成、蒸馏、知识提取等。
计算一下,如果每次 API 调用输出 1000 token,生成 1 万亿 token,需要约10 亿次调用。
生成 15 万亿 token,则需要150 亿次调用。
因此,这并不排除有针对性的采集行为。
但它反驳了一种简单化想象,即某家公司通过 API 获取大量回答,然后直接组成一个前沿模型全部训练数据。
更现实的例子是 FineWeb-Edu。
研究人员让 Llama 3 70B 给 46 万个网页进行教育质量评分,然后用这些评分训练线性回归模型,再将评分推广到 FineWeb 的 15 万亿 token 数据,筛选出 1.3 万亿 token 的教育数据子集。
实验显示,FineWeb-Edu 在多个知识和推理相关基准测试中,超过了他们比较的其他公开网页数据集。
误区五:“我们知道能力到底转移了多少”
目前我没有看到一种方法,或者充分证据,可以准确衡量蒸馏到底贡献了多少能力。
打个比方,老师给学生 1000 道例题。之后学生独自练习 100 万道题,最后考试满分。
那么,多少功劳属于老师?多少属于学生?多少属于练习过程?很难拆分。
现有研究显示了多个方向,一方面,有证据表明带有可验证奖励的强化学习,主要是在让基础模型中已经潜在存在的能力更容易被激活。
另一方面,也有证据显示,教师指导的课程式强化学习,可以扩大模型表现出来的推理边界。
还有一些蒸馏实验表明,可以转移教师模型拥有、但学生模型仅靠原始奖励信号无法获得的信息。
因此,讨论 AI 蒸馏时,更值得关注的问题不是“有没有蒸馏?”而是到底转移了什么?
是答案、推理过程、偏好,还是评分标准?发生在哪个阶段?规模有多大?
这些问题,才是真正决定蒸馏影响程度的关键。
热门跟贴