最近AI圈出了个大新闻。字节跳动创始人张一鸣罕见发声,明确表示字节跳动不会把“蒸馏”当作提升AI模型能力的捷径,哪怕这意味着公司眼下落后于国内竞争对手。
这话一出,圈内圈外议论纷纷。有人夸字节有良心、有底线,也有人说这是在作秀。但仔细琢磨一下,这事背后藏着不少值得说道的门道。
**先说说什么叫“蒸馏”**
模型蒸馏,说白了就是拿别人已经训练好的大模型的“输出结果”,来训练自己的小模型。打个不太准确的比方:好比你想学做菜,不用自己从切菜、颠勺开始练,直接拿米其林大厨做好的成品来研究、模仿,省时省力,进步还快。
这项技术在科技行业普遍存在,本身并不违法。问题在于,你有没有未经许可大规模“偷师”别人的专有模型。今年以来,美国AI公司Anthropic就公开指控多家中国AI企业通过大量虚假账号和代理网络获取其模型输出。美国财政部长甚至放话,如果中国企业使用构成知识产权盗窃的“工业级蒸馏攻击”,可能面临制裁。
正是在这个节骨眼上,张一鸣的表态显得格外引人注目。
**字节的3个顾虑,不只是“良心发现”**
很多人第一反应是:字节不做蒸馏,是不是良心企业?其实没那么简单。
**第一个顾虑,也是最现实的——TikTok的海外包袱。**
字节跳动旗下有TikTok这个全球体量的产品。从特朗普政府时期开始,TikTok在美国就屡屡面临国家安全审查和封禁威胁。今年1月,TikTok刚刚完成美国业务重组,成立了由美国投资者持有多数股权的合资公司。可以说,字节在海外如履薄冰。
如果此时被指控大规模提取美国前沿模型能力,华盛顿方面很可能借机再次向TikTok施压。《The Information》的报道也提到,字节拒绝依赖蒸馏技术的一个原因,就是公司与美国政府就TikTok问题的复杂历史。这层顾虑,是那些没有海外业务的新玩家根本不用操心的。
**第二个顾虑——技术路线的判断。**
张一鸣在内部会议上说得很直白:做模型要坚持长期主义、延迟满足感,而不是用别人的输出换一时的榜单排名。他认为蒸馏会“干扰真正意义上的长期技术突破”。
说白了,字节内部对这条路是有分歧的。据员工透露,每当国内发布一个强大的开源新模型,Seed团队内部关于是否应该转向蒸馏的争论就会升温。但张一鸣最终还是拍了板——不走捷径。
值得一提的是,字节跳动是国内主要AI公司中唯一一家大语言模型几乎全为专有模型的企业。它在AI视频生成领域却是全球公认的领导者,Seedance模型今年早些时候因能生成超逼真视频而引发轰动。
**第三个顾虑——避免被“带节奏”。**
目前Anthropic公开指控的中国AI实验室名单里,包括通义千问、DeepSeek、月之暗面和MiniMax等,但并不包括字节跳动的Seed系列模型。字节选择不碰蒸馏,某种程度上也是在规避成为下一个被“点名”的目标。
**大厂有包袱,新玩家反而能冲**
对比一下就能看出来。像阿里巴巴、腾讯这些大厂,都有庞大的海外业务布局。一旦在蒸馏问题上引发争议,直接影响的是全球市场信任和合规成本。所以它们做事难免束手束脚,不敢像新玩家那样放开手脚。
反观Kimi、DeepSeek、智谱清言这些新玩家,没有大厂的既得利益包袱,反而能快速冲到前面。有字节员工就坦言,公司不愿采用蒸馏,是其大语言模型落后于阿里巴巴以及DeepSeek、智谱AI和月之暗面等国内AI公司的一项重要原因。
**守成就是等死,突破才是活路**
有人可能会说,字节这是有底线、有担当。但仔细想想,那些既得利益者,本来就不想看到新玩家打破现有格局。
微软CEO纳德拉前段时间就在社交媒体上含蓄批评了一些AI模型公司的“双标”做法——一边主张拥有利用公开数据训练AI模型的“合理使用”权利,一边却反对其他公司通过蒸馏来提升模型能力。说白了就是:胳膊粗了就想立规矩。
不管是企业还是个人,守着既得利益不放,总想着按自己舒服的规则来玩,其实很难有真正的突破。张一鸣的话,听听就行。真正值得学习的,是那些敢闯敢拼的新玩家——放下包袱才能杀出一条血路。
**说到底,这是个选择题**
字节选择不做蒸馏,有它的现实考量:TikTok的海外包袱、长期主义的技术判断、避免成为靶子。新玩家选择做蒸馏,也有它们的生存逻辑:没有历史包袱、需要快速追赶、规则还没定型之前先跑起来再说。
没有对错,只有选择。
至于新玩家能不能靠蒸馏完成超车,大厂能不能靠长期主义守住阵地——答案,可能还要再等几年才能揭晓。
热门跟贴