之前字节Seed全员会的消息流出来,全网都在脑补,张一鸣不肯碰模型蒸馏,全是为了规避TikTok的地缘风险。挖了一圈靠谱的内部信息才发现,这事和TikTok半毛钱关系都没有。真正拍板的动因,是字节磨了三年的大模型研发底层路线之争,从一开始就选了最难的那条路。
大多数人不知道,字节对蒸馏的警惕,远在蒸馏变成敏感词之前就定好了规矩。2023年4月,字节刚落地GPT API调用规范检查,模型团队直接出了硬要求,绝对不许把GPT生成的数据加到自家模型的训练集里。后续还做多轮抽样检测,专门比对内部模型输出和GPT内容的相似度,就怕标注员私下用GPT攒数据混进去。这套规则和后来的地缘风险、海外压力一点关系都没有,纯纯是团队主动选的长期研发路径。
那时候国内大模型刚进入百模大战,绝大多数团队都在拿外部API生成数据快速填训练集,字节是少有的主动给自己上枷锁的头部玩家。放着现成的效率捷径不走,偏要啃全自研这块硬骨头,放在当时看真的有点反常识。
2025年开始,外部环境大变,三年前定的规矩接连遭遇三次强力挑战。每一次都有同行突破带来的实实在在的冲击,每一次都有足够的理由,让蒸馏变成性价比最高的选项。
第一次争论是DeepSeek-R1发布之后,这款模型用有限训练成本拿出了震动硅谷的推理能力。Seed内部不少研究员都纳闷,我们人才密度算力投入都不比同行差,怎么自家模型的推理表现没追上人家。当时业内有猜测,不少头部模型快速迭代都用了海外SOTA模型的生成数据。有人提折中方案:保留原来的全自研预训练体系,只拿海外强模型的输出补一补推理能力短板,相当于给模型开个速效补药。这个提议刚提上来,就被管理层直接否决了。
第二次争论的导火索,是英伟达Blackwell系列GPU在美国头部实验室大规模商用。受出口管制影响,国内实验室能拿到的H20芯片,训练综合性能只有B200的五十分之一,中美顶尖AI团队的算力鸿沟一下被拉大。这次支持蒸馏的研究员拿出了更务实的说法:既然短期补不上算力差距,不如先用高质量外部数据换能力提升,把稀缺的算力集中到已经跑通的模型赛道。这个说法当时获得了不少支持,差点就成了内部共识。
真正把讨论推到沸点的,是规模算力都远小于Seed的团队推出Kimi K3,直接把开放权重模型的能力拉到了和美国头部闭源模型同一水平。这次冲击比前两次都直接,投入更多资源的Seed语言模型,还没拿出同级别的成果。
这次甚至有人提出了风险更低的折中方案:不碰闭源模型,只蒸馏授权更宽松的开放权重模型,自己本地部署生成数据,完全绕开了注册和地域限制,几乎没什么法律风险。也就是这次,张一鸣一锤定音,明确表态:闭源模型不能蒸馏,开放权重模型也不能蒸馏。
很多人都觉得字节这个选择没法理解,蒸馏本来就是行业通用的成熟技术,自蒸馏用自身模型生成数据反哺训练,本来就是所有头部实验室的常规操作。其实字节禁止的从来不是自蒸馏,是把外部SOTA模型当“教师爷”,沿着别人走通的路抄近道。
一款模型可以靠蒸馏冲进前沿,一家实验室却不能靠蒸馏成为真正的前沿引领者。这条路诱惑真的太大了,只要批量拿到强模型的推理轨迹、代码输出、复杂任务处理过程,短短几个月就能补齐榜单上的能力差距,让产品快速挤进第一阵营。可这条捷径背后藏着看不见的致命陷阱:你永远搞不懂这些能力到底是怎么产生的。
习惯了跟着别人的脚印走,就会彻底丢掉独立探索未知边界的能力。等现在的SOTA模型摸到了智能天花板,你根本不知道下一步该往哪走,只能永远跟在别人屁股后面,永远没机会摸到真正的行业天花板。
张一鸣要的从来不是短期内榜单上好看的数字,而是能独立摸到全球大模型智能边界的底层能力。他在Seed全员会上说“愿意牺牲一些短期利益”,本质上就是要保住团队最珍贵的独立探索文化,不让走捷径的习惯消解掉底层研究的原生动力。
现在的Seed,确实要为这个选择付出更高的成本。要投更多算力,要容忍更长的试错周期,要接受短期内部分榜单的暂时落后。但这些短期付出,换回来的是一套完全属于自己的、从底层逻辑出发的大模型研发体系。
这套体系里没有任何外来的路径依赖,所有能力的生成逻辑都完全可控。等行业走到下一个技术范式转换的临界点,那些靠蒸馏快速堆出成绩的团队会直接找不到方向,反而长期扎根底层探索的团队,最有可能率先摸到下一个智能跃迁的入口。
这不是什么道德洁癖的选择,是一次关于长期主义的硬核下注。字节用整整三年时间,三次顶住了近在眼前的捷径诱惑,本质上是在给中国大模型行业保留一份纯粹的底层研究火种。
未来回头看你会发现,真正能定义下一代大模型智能边界的团队,从来都不是那些靠抄近路快速登顶的玩家。是那些在无人区摸黑走了很久,踩过无数坑,完全靠自己搞懂每一步底层逻辑的人。现在所有的暂时落后,都是在给未来的真正领跑攒下最扎实的底气。
参考资料:新华网 我国生成式人工智能高质量发展观察
热门跟贴