多模态联合预训练正在成为大模型演进的下一站,从 GPT-4o、Gemini、到最近 Kimi3 都走上了这条路。但在现有实践中,面对一些关键决策,如模态之间在训练时如何互相影响、数据配比和不同模态数据的引入顺序、架构设计等,行业大多依靠经验和直觉,摸索着前行。
牛津大学博士、Meta 基础人工智能研究院(FAIR)研究员韩俊霖和团队正试图改变这一现状,他们借鉴了 FAIR 资深研究员朱泽园(Zeyuan Allen-Zhu)提出的“语言模型物理学”框架,用严格受控实验的方式对多模态训练涉及的几大变量展开分析。8 月,相关论文以《迈向多模态预训练的物理学研究》(Towards Physics of Multimodal Pretraining)为题发表在 arXiv。
团队先在合成数据里建立干净的实验环境找到基本规律,其中部分使用程序化生成的三维场景数据集,精确控制每个概念在训练数据中的出现与否,进而将相关性观察明确为因果判断。随后,他们使用约 3.5 亿对图文数据和大规模网络文本、真实数据、多种不同的视觉表征设计(如表征自编码器 RAE、原始像素 Raw Pixels、离散 Token 等)和大规模模型验证这些规律是否真正成立。
结果显示,知识的流动是不对称的:语言是所有视觉能力的“万能助推器”,视觉理解可以有效驱动视觉生成,但视觉生成对其他能力几乎没有正向贡献。这种不对称性在概念上存在细致的分层:颜色、形状等底层概念在理解和生成之间无法零样本迁移,但空间关系、大小、数量这类高层结构概念则可以从理解单向传给生成。
另外,三种模态的协同与竞争取决于任务复杂度和架构。例如,简单视觉任务反而能提升语言能力,复杂任务会引发模态对参数容量的争夺。从架构上看,前馈网络(FFN)是竞争的主要部分,因此应按模态解耦,注意力机制(Attention)和归一化层(Norm)是协同的桥梁,可在不同模态间共享资源。
在引入顺序上,韩俊霖和团队发现,越早引入视觉越好,否则会产生“视觉惰性”,即语言主干训练得越充分,模型越倾向于走语言捷径来“糊弄”视觉问题,视觉通路的参与度越低。这也解释了为什么许多强大的多模态大模型仍会犯明显的视觉错误。
通过遍历数据配比,团队给出了语言数据占 70%、视觉理解 25%、视觉生成 5% 的最优训练配方。论文中初步解释了原因:语言和理解建立的底层表征已经提供了足够强的先验,因此生成任务仅需极少量数据也能有不错的表现。该配方在 135 亿参数的混合专家模型、2 万亿 Token 的规模上得到验证,全面优于平衡配比和其他基线方案。
这些核心结论为过去主要依赖试错的多模态训练,搭建起一套更可靠、更严谨、可解释的框架。
文章发布后,DeepTech 与韩俊霖进行了一次深度对话。在他看来,他们的发现并未颠覆现有模型训练范式,而是“用更清晰的方式点明一些之前处于模糊地带的共识”。他同时希望借此呼吁行业,原生多模态训练应该尽早开始,不能只依赖后期对齐和基准测试(Benchmark)。
今年 6 月,韩俊霖在博客中给出“3D 不是智能”的判断,对此,他也提到了自己从三维生成和视频生成转向多模态统一预训练的探索历程。
关于大模型规模化(Scaling)的未来,他的判断是,语言数据可能会接近瓶颈,各家已经在用大量合成数据和数据重复“凑”出下一版本模型的训练量;但视频数据的 Scaling“完全没到头”,例如仅 YouTube 的规模就足够整个行业消化很久。不过,对于视频如何与其他模态结合、用什么架构做 Scaling,业界还没有形成共识。
谈及接下来的方向,他透露自己即将离开 Meta,转向以视频为主的 Scaling 研究。
以下是我们的对话,经过编辑整理。
从 3D 到多模态,以及算力对研究方向的影响
DeepTech:你之前的研究方向侧重 3D 生成和视频生成,后来逐渐转向多模态预训练,还在今年 6 月的博客里专门写了“3D 不是智能”。你是怎么意识到这件事,并决定转换研究方向的?
韩俊霖:我从 2023 年就开始做 3D 生成,2023 年底加入 Meta 和牛津后,也在继续做,直到 2024 年底之后基本不怎么做了。这背后有两个原因。一个比较客观的因素是 Meta 内部进行了组织调整,我们当时被从 3D 组调到了 Llama 视觉组做后训练,部门对 3D 的支持相应减少。
第二个原因是我个人认为,一个真正能学到通用智能的东西,应该是可以规模化扩展的,训练数据至少要容易获得、容易被用于做规模化。但 3D 不太满足这个要求。
2023 年,我们能用的高质量 3D 数据可能就数十万个的量级,这还是 Meta 花了很多钱买的。所以那时我就觉得,受限于数据稀缺,加上又是一个人为制造的表示范式,3D 不是特别可扩展。
两个原因加起来,促使我在 2024 年底开始转向其他领域。
DeepTech:你离开 3D 领域的时间比在网上发博客表态的时间要早得多。
韩俊霖:对,写那篇博客的契机是,当时 CVPR(计算机视觉与模式识别会议)又把很多最佳论文奖给了一些聚焦 3D、4D 的工作,很多作者我都认识。但我觉得,整个计算机视觉领域已经连续几年特别侧重这个方向,比较好的多模态大语言模型的工作,或者在视频里做 Scaling 的工作在会议得到的关注变少。3D 并不是不重要了,只是我想借博客发表一点看法,可能 3D 是要和其他模态逐渐对齐联合,作为其中的一环,而不是以独立的模态单独存在研究。
DeepTech:你现在在英国,之前也接触过美国湾区那边的工作和研究环境,两边有什么区别?
韩俊霖:这要把学界和业界分开说。
美国那边,特别是西海岸湾区,大家跟业界的联系比较紧密,对业界进展的体会比较强烈,从事基础模型或 Scaling 类工作的兴趣更高。比如斯坦福、伯克利等机构的同学会踊跃参与实习,甚至有比较极端的,读完博一就退学,直接进入业界。
英国业界的资源就不太好。严格来说,只有谷歌 DeepMind 比较有话语权、有大量招聘名额,其他公司只在这边设一些小的分部。所以英国学界受业界前沿的冲击很小,很多人还在研究监管、安全等问题。
DeepTech:你同时在牛津和 Meta 工作,两边对研究的侧重又有什么不同?
韩俊霖:算力是最明显的区别。在 Meta 用几百张卡一般不是问题;但在牛津,你用四张卡就很头疼了。受这一点制约,两边的侧重点会很不一样。
从模型训练来讲,在 Meta 我更多会做比较吃资源的预训练,关注一些 Scaling 的规律。在牛津更多是合作一些项目做后训练,因为卡的制约比较大,所以会找一些以前没人切入的新角度。牛津这边组里很多人会做纯 3D,或者有关可解释性、安全性的方向。
打开那个黑箱
DeepTech:用受控实验研究多模态训练机制的方式,在你们这个领域内算常见吗?为什么选择这么做?
韩俊霖:我们这个研究方式,主要受到大语言模型领域一个著名工作的影响,叫“语言模型的物理学”(Physics of Language Models),主导者是 Meta 的 Zeyuan Allen-Zhu,也是我非常尊敬的一个朋友。他们的核心思想是在比较干净的环境里找到一些具有迁移性、可推广的底层规律,以此优化 Scaling 策略和模型设计。
在之前计算机视觉和 AI 领域,大家以前也会用一些合成环境或者比较受控的东西来做实验,比如符号 AI 的一些工作也会经常用 CLEVR 这个生成数据集来做实验。
DeepTech:《麻省理工科技评论》今年选出的十大突破性技术之一是机制可解释性(Mechanistic Interpretability)。我觉得你们的工作有一些与之相通的地方,都希望把黑箱打开看看。
韩俊霖:对,确实有相关性,但也涉及一个区别:机制可解释性更偏逆向工程,借助探针或回路分析去解剖模型内部的微观计算机制;而我们更偏受控实验物理学,先搭建干净、可控的实验环境,观察模型在不同条件下的演化与涌现规律,提炼出可迁移的宏观规律后再做推广验证。
DeepTech:你们发现,视觉生成几乎不能把知识迁移给语言或理解,但微调之后,在生成任务里见过某个概念的模型,学会理解这个概念的速度明显更快。如何解释这种“存在潜在先验但无法直接激活”的现象?
韩俊霖:研究这个问题的背景是,多模态领域内一直存在争论:到底是理解帮助生成,还是生成帮助理解?之前很多观察发现,主要是理解在帮生成,生成的反向贡献比较少,或者只在非常特殊的情况下才有帮助。
我们在此基础上深挖了一下,发现如果只看 Benchmark,生成在大多数情况下确实不太能帮到理解;但它其实学到了一些潜在的像素级特征,比如颜色、形状等,这些可能对视觉理解有用。
至于是不是一定要微调之后才能体现出来?那倒不一定。现在视觉问答(VQA)测试的都是一些比较高层的任务,很少有 VQA 会问模型一个东西是什么颜色,因为太简单了,这就导致它在生成里学到的像素级知识很难体现出来。而如果用一些对像素要求更高的视觉任务进行测试,比如物体之间的联系、追踪,就会发现生成的作用。
用微调主要是想在可控环境里看它的恢复速度,以此确定模型有没有从生成中学到一些对理解有用的潜在表征。
DeepTech:你们区分了高层和低层概念,这两类概念之间迁移程度不一样。这个边界是明确的还是连续的?
韩俊霖:我们还没有找到一个特别明确的阈值。可以这么理解,从最底层的像素到最高层的抽象是一个连续的光谱。如果这是一条 10 厘米的轴,0 是最底层,10 是最高层,我觉得阈值可能在 2 左右:在小部分非常底层的概念中,生成对理解的帮助更大;而绝大多数中层和高层的区域,都是理解在起主要作用。
DeepTech:你们发现理解和生成之间在低层和高层概念上的迁移是不对称的,那么语言在这两类概念中的迁移情况如何?
韩俊霖:我们今年早些时候在 ICLR(国际学习表征会议)发表了一篇口头报告工作,名为《先学会看再看》(Learning to See Before Seeing),专门研究语言预训练对视觉理解的先验迁移。和这篇一起得出的结论是,语言对视觉理解的帮助总体会比对生成大一些。
因为视觉推理本质上也是语言推理,语言的推理先验对视觉推理的帮助非常大。至于视觉感知任务,比如能不能看清某些东西、某些东西存不存在,语言也有帮助,但主要散布在一些更广泛的来源里。
总体而言,从一个好的语言模型起步,会在很大程度上优化视觉理解。
而生成分两种,无条件生成和文本到图像的生成。我们发现,语言对无条件生成的帮助很小;而在文本到图像生成中,如果只看模型能否理解更复杂的提示、做更精确的生成,语言的帮助非常大;但如果不看提示,专注于图像质量和最后出来好不好看,那其实跟语言没有特别大的关系。
在语言和视频中,Scaling 的边界分别在哪?
DeepTech:在目前的规模下,视觉生成对理解没有正向迁移。但这个结论或许依赖于当前的生成范式,即模型在像素空间做重建。如果生成目标换成预测场景的下一个状态,比如世界模型,你觉得这种不对称性会不会改变?
韩俊霖:我有参与 FAIR 今年 3 月发表了一篇名为《超越语言建模》(Beyond Language Modeling)的文章,是其他同事主要做的。这篇文章有探索世界建模,方法上是用统一模型训练,学习视频生成,跟我们现在这个差不多。
最后发现,导航等比较基础的世界建模能力,是可以在投入大量视频数据后涌现出来的。也就是说,99% 的视频生成数据加上 1% 的世界建模数据,会比反过来的配比效果好。
回到你的问题:像素建模和世界建模对其他能力的影响会不会不一样,我觉得是会的。像素建模要求模型精确还原每个像素,这和理解任务所需的抽象表征差别比较大。而世界建模既要预测一些东西,又要理解当前的动作会引出怎样的场景,因此会介于从生成任务转向理解任务的中间状态,而且主要偏向理解。
DeepTech:你们在论文的展望里提到,随着规模扩大,生成对理解的反向促进可能会出现。所以你现在还是比较认可 Scaling 这条路径?
韩俊霖:我是比较认可的。规模更大,见过更多生成/理解的图片/视频后,模型内部可能会整合得更紧密,它可能会更容易找到一些共性和优化方向。
比如现在具身智能领域的其中两条主流路线:用统一模型作为基座来做 VLA 视觉-语言-动作模型和 WAM 世界动作模型,都涉及大量的视觉生成。统一模型见过很多视觉生成数据,而世界动作模型要预测下一状态帧。这种能力对机器人的操作是有帮助的,因为机器人执行动作,靠的正是预测下一个状态。因此,预训练规模更大之后,模型或许会有更好的涌现,能完成更多下游任务。
DeepTech:行业里也有另一种声音,觉得不能一直做 Scaling,应该做更有效率的事情,比如把训练数据压缩到很低的程度,实现零样本迁移。你怎么看这条路线?
韩俊霖:2022 年、2023 年大语言模型刚火的时候,就经常有人提小样本学习。但我认为,当前的主流范式还是在预训练阶段打好底子做 Scaling;在这个基础上,如果有哪些地方没做好,再用几十条或几百条把它补上,这种方法更高效一点。
在我看来,小样本只能教会它处理某类特定的情况,撑不起真正的通用能力,模型还是要靠 Scaling 来学习世界知识。所以短期来看,规模化预训练配合好的后训练数据,依然是更有希望的路线。
DeepTech:很多人担心数据总有耗尽的一天。就像你之前不做 3D 也有数据的原因。
韩俊霖:这个要分开来看。一边是正在接近极限的语言数据,另一边是还有巨大 Scaling 潜力的视频数据。
语言这边,各家模型的训练数据量都很大,预训练可能就达到 30-50 万亿 Token 甚至更大的量级。后面再扩大,还能再接着加更多合成数据或者视觉-语言配对数据,大概还能凑出二三十万亿,有些比较好的数据还可以重复几次。因此,下一代模型靠这些数据再训个 5 万亿参数的模型问题不大,至于再往后模型规模如果还要进一步扩大,相匹配的真实数据不够用了该怎么办,我就不知道了。
但我认为,视频的 Scaling 还完全没有到头。虽然其中很多有噪声、压缩得不是特别好,但视频的数据量太大了,光是 YouTube(上的数据)就够大家用很久。
不过,目前行业内对视频 Scaling 的架构和范式还没有形成共识,怎么让视频或者其他更多模态成为智能的一环,甚至对语言起到帮助作用,这些问题的探索空间还很大。
DeepTech:研究发现了一些底层的机制性现象,比如注意力层的协同、前馈网络的资源竞争、视觉惰性等。这看上去似乎和神经科学相关,你们认为怎么解释比较好?
韩俊霖:确实有神经科学领域的学者联系我,认为这些结论很有道理。从他们的角度看可能有一些比较强的相关性。但我们在做研究时并没有特别刻意地与人脑建立联系。
大模型的整体学习范式和人脑有相似之处,也有很多不同之处。其中,混合专家(MoE)架构会有点像人脑里神经元的分工。但不能因此就说模型一定要严格按人脑的方式来组织,比如用左右脑分别处理不同任务。功能上可能有一些类比,但机制应该不会完全一样。
我更倾向于用网络机制来解释:前馈网络主要负责存储知识,注意力负责信息交付或信息重组,所有信息都流经归一化,统一处理后再往下游送。
从这个角度看,前馈网络里不同模态之间是竞争关系。而在注意力和归一化层面,不同模态同时经过,其实是有益处的。比如在注意力层,你原本只有 500 个语言 Token,现在多了 500 个图像 Token,相当于多锻炼了 500 个,模型从中学会了该怎么连接图像和语言,能处理更长的上下文任务,而这也会对归一化带来一些正则化的效果。
配方、行业启示,与多模态的下一步
DeepTech:这项工作最终得出了一个多模态数据配方。你们是先有预设再验证,还是没有预设、纯粹试出来的?
韩俊霖:有预设,但也做了所有配方的实验。
预设来自前期的知识流动实验,看到语言对理解有促进、对生成也有促进,理解对生成有促进,但生成对其他两个的促进比较少。在这个基础上,模型的训练肯定由促进作用比较大的语言部分占主导,理解更少,生成最少。
还有一个预设参考了 Kimi、Gemini 等比较好的前沿模型,它们一开始训练就加入了语言和视觉理解,但视觉占比一般不高于 20%。
我们当然不能只带着预设跑一下就完事,所以还是用了比较暴力的方式,把所有语言和视觉配比都跑了一遍,最后确实发现,在我们的实验环境里,语言占 70% 左右,理解 25%、生成 5% 的结果是最好的。
各家的数据、模型会有区别,这个配比也不是绝对精准的,更多代表了一种可迁移的趋势和理念:要想训练一个有生成能力的统一多模态大模型,起码在预训练的初期或者中期训练之前,应该遵循语言占据绝大多数、理解次之,生成最少的原则。
DeepTech:你们除了研究数据配比,还看了引入这些数据的先后顺序。最后发现联合训练优于任何顺序训练。这个结论也是先有预设吗?
韩俊霖:原来的多模态大语言模型可能更多是先训语言,在此基础上加入视觉。但也有人说如果按人的学习方式,训练是先视觉后语言,当然我们也可以让每个模态都是“原生”的,从一开始就一起学。
于是我们想到把各种潜在的学习方式都放在一起进行比较,发现哪种顺序训练的效果都不如统一训练。
主要原因是网络学习存在遗忘问题,如果不重放原来的数据,这种学习顺序就会导致遗忘。而且网络的遗忘会比人更严重,也更明显。而从初期进行原生联合训练,不仅能让各模态的发展更均衡,也能从机制上克服比如“视觉惰性”这种现象。
DeepTech:这项研究对当前主流的多模态模型开发有哪些启示?你觉得现在哪些“惯例”该被打破了?
韩俊霖:此前大家也都有一些模糊的觉察,我们的研究中没有完全没被注意到,或者特别具有颠覆性的东西,只是这篇文章可以让大家能更快做出一些范式的转变。
一个是原生多模态要不要做,我觉得是有必要的。虽然不一定非要从头,至少也该从一个比较早期的阶段做起。在比较晚的阶段接入的能力,看上去 Benchmark 的表现还不错,但花同样算力把它放在早期做,效果只会更好。
另一个是怎么做对比研究。最近这些年,业内越来越看重 Benchmark,但有些东西是 Benchmark 测不出来的,比如前面我们提到了生成到理解的可迁移性。
我并不否认 Benchmark 越来越多,覆盖面也会越来越全。但从做研究的角度看,随着模型越来越多,只看现有榜单,还是会错过很多有趣的发现,毕竟模型的很多能力或许本来就不容易体现在分数里。
在这种情况下,研究者应该思考,能不能脱离 Benchmark 和刷榜的氛围,去寻找一些更有原则性、更加可扩展的结论,这也是有意思的研究模式。
DeepTech:引入视频、音频等更多模态后,你们找到的这些规律会不会发生变化?
韩俊霖:先说架构。最近我们看到,英伟达的 Cosmos 3 尝试融合了更多模态,用一个类似模态混合专家(MoT)的设计,在前馈网络解耦,其他部分尽量共享。数据上的话,他们是从预训练好的语言模型开始的,但如果完全从头做,在数据配比上,我相信它们也是需要语言占比更大,但具体数值可能不会完全一致。
更多模态的加入会让计算变得更复杂,肯定会有一些小的波动,但我们给出的配方和总体规律依然具备较强的可迁移性。
DeepTech:你的下一步方向是什么?
韩俊霖:我已经临近博士毕业,很快会从 Meta 离职,肯定不会彻底脱离语言,但侧重点会放在视频的 Scaling 上,或者探索视频与其他模态结合的 Scaling,这些领域的问题很有趣,而且还没被完全解决。
参考内容:
https://junlinhan.github.io/projects/physics_of_mm_pretrain/
https://arxiv.org/html/2603.03276v1
https://junlinhan.github.io/blogs/from-3d-to-intelligence.html
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴