2016年4月,由 新加坡国立大学计算机科学系教授陈树霖主导,联合还在百度深度学习研究院的余凯、黄畅等人,提出了Text Flow,在自然场景图像中统一文本检测技术。
十年后的今天,新一轮生成式AI大模型、世界模型爆发的背景下,地平线创始人余凯,地平线联合创始人黄畅,再度联手发表新的研究成果。
10月1日消息,智能纪元AGI独家获悉,今天,华中科技大学、北京交通大学与地平线机器人联合提出Multimodal Flow(MF‑1)。
这是一套开源的、完全连续的多模态生成框架,也是语言-视觉统一模型,最大特点是在嵌入空间中统一建模文本与图像,依靠 Flow Matching 实现语言、视觉共享同一套生成目标与采样流程,规避现有离散、混合范式的缺陷,从而为语言建模、视觉理解、图像生成、编辑、视频序列以及未来可表示为有序连续块的各种模态技术做基础AI技术能力。
MF‑1最大版本是1.6B(16亿)参数,只用了150B预训练Token。在 GenEval 上拿到82.8分,DPG-Bench 75.3分,超过了多个多模态模型的性能。
本论文通讯作者是华中科技大学电子信息与通信学院教授、Vision Lab团队负责人王兴刚。
参与的作者包括地平线创始人余凯,联合创始人黄畅等。
今年2月,地平线提出的端到端强化学习后训练范式RAD,也是基于地平线-华中科技大学计算机视觉联合实验室,由王兴刚团队与地平线团队联合研发。
我特意翻看了Google学术和Alphaxiv,2016年之后很少见余凯署名的论文。
那么,十年过去了,作为AI学术大牛,也是百度IDL和自动驾驶开拓者,如今还是一家上市公司创始人、董事长,余凯罕见参与的研究成果,到底做了哪些新的技术工作?
统一多模态,
把图像和文本都变成“超块”
今年5月,余凯在一个活动上说, 行业里什么VLA、VLM、End-to-End、世界模型,很多时候别扯这些词,商业意义大于实质。真正靠谱的团队,做的事情其实都差不多。
他指出,所谓世界模型,说到底也是一种仿真,用来生成大量虚拟数据,这件事并没有哪家不做。那些技术(路线)buzz word,很多时候成了车企老板和自媒体的谈资。真正还在牌桌上的玩家,技术路线并没有本质区别,细节才是魔鬼。
这其实体现出了一个余凯独特的技术思考:各种多模态模型需要统一,语言、动作和视觉需要有一个大一统的体系。
所以,过去两年,多模态和物理AI大模型的路线之争,本质上是一个问题:语言和图像,到底该不该用同一套“Token(词元)”来建模?
主流答案分两派。
一派是全离散路线:把图像也切成视觉 Token,和文本 Token 混在一起,丢进同一个自回归模型里。LWM、Show-o、Emu3-Gen、Muddit 都走这条路。
好处是统一,而坏处也很直接,图像量化是个信息瓶颈,细粒度细节在 Tokenizer 那一步就丢了,模型再强也找不回来。
另一派是混合路线:文本保持离散自回归,图像走连续扩散或流模型。Transfusion、JanusFlow、D-DIT 是代表。
这条路避开了量化损失,但代价是两套目标函数、两套采样流程,语言和视觉之间始终隔着一层“翻译”。
两条路都有道理,但都不彻底。
这次,华中科技大学、北京交通大学和地平线团队扔出了一个新方案:Multimodal Flow。
Multimodal Flow的回答很干脆,别切Token了,语言和图像都在连续嵌入空间里,用一条Flow Matching流统一建模。
所以,Multimodal Flow 的第一步,是给语言和视觉找一个共同的“连续表示空间”。
具体做法不复杂:
1、图像层面:用冻结的 SigLIP 2 编码器编码,再做层归一化,得到连续的视觉状态。每张图像形成一个"视觉超块"(visual hyperchunk)。
2、文本层面:用冻结的 T5-small 编码器编码,然后按固定长度分块(论文里B=8,也就是每 8 个Token一块),每块做层归一化,形成"文本超块"(text hyperchunk)。
再解释一下, 超块(hyperchunk)是这篇论文自己造的一个表示单元,核心在于,把文本和图像都切成“连续向量块”,用统一的粒度去建模。
注意这里的关键设计,文本超块保留了原始 Token 顺序,图像超块保留了空间结构。
模态特定的结构没有被抹平,只是被装进了统一的连续容器里。
然后,模态特定的输入投影层把这些超块映射到一个共同的隐藏空间,再加上模态嵌入和位置编码(MRoPE),就可以送进骨干网络了。
这个设计解决了统一多模态里最头疼的矛盾:既要共享生成过程,又要保留各自的表示结构。
之前的方案,要么牺牲图像细节(全离散),要么牺牲架构统一(混合),而Multimodal Flow 选择了第三条路。
那么,有了统一的超块序列,接下来的问题是:怎么建模?
Multimodal Flow 用的是一个chunk-causal(块因果)流骨干。
听起来抽象,拆开看其实很清楚:
第一,块因果注意力。
整个序列被看作有序的超块序列,联合分布按超块顺序分解。预测当前超块时,能看到所有之前的超块,但看不到未来的。这和自回归的因果掩码逻辑一致,但粒度是"块"而不是"Token"。
第二,联合注意力做跨模态交互。
文本和图像超块在同一个注意力空间里交互,不需要专门的跨注意力层。这意味着模型可以自然地处理"文本→图像""图像→文本""文本+图像→文本"等任意方向的条件生成。
第三,模态特定前馈网络(FFN)。
注意力是共享的,但 FFN 是分开的,文本超块走文本 FFN,视觉超块走视觉 FFN。论文做了消融实验,结论很明确:共享注意力投影+模态特定 FFN 是最优配置,共享 FFN 反而会拉低性能,尤其是文生图任务。
核心在于,跨模态的“关系”可以共享,但每种模态的“表示统计特性”不一样,需要各自的变换空间来适配。
值得一提的是,Multimodal Flow 用的是 Flow Matching 目标,在训练和推理阶段做了不一样设计。
比如,训练阶段采取并行方案,这意味着训练效率很高,不管序列多长,一次前向就能算完所有块的损失;而推理阶段是顺序的,给定前缀文本,下一个目标超块从高斯噪声开始初始化,把噪声逐步变成干净表示,生成完一个块,缓存它的 KV,再生成下一个。
这个“训练并行、推理顺序”的设计,和自回归模型的逻辑类似,但因为是连续流,每个块的生成本身是一个 ODE 积分过程,而不是一次性的 Token 采样。另外,模型还支持无分类器引导(CFG)。
混合预训练,
150B Token实验到底有多能打?
而Multimodal Flow最值得注意的设计之一,是它的混合多模态预训练,Mixed Multimodal Pretraining。
传统做法里,文本建模、图像生成、图文理解往往是分开训练或分阶段微调的。
但Multimodal Flow把这些任务全部统一到同一个 Flow Matching 目标下:
纯文本数据:文本块序列,每个块是无条件目标
纯图像数据:一个视觉超块,无条件生成
图文配对(文生图):文本前缀+视觉目标
图文配对(图生文):视觉前缀+文本目标
任务不同,但接口、因果结构、目标函数完全一样,变的只是块序列的顺序和目标模态,模型在一个混合分布里同时学语言建模、图像生成和跨模态对齐。
效果很直观。论文对比了随机初始化和混合预训练两种起点。
在相同的下游微调预算下,从结果可以看到,混合预训练给模型带来了全方位的飞跃。
比如,图像生成的组合能力指标 GenEval 从 0.527 暴涨至 0.821;考验长提示跟随能力的 DPG‑Bench,分数从 57.81 提升到 83.44。
多模态理解侧提升同样惊人。综合评测 SEED‑Bench 直接翻倍,从 31.6 来到 62.4;MMBench 理解分数从 36.0 提升至 67.2;需要外部知识的 OK‑VQA 视觉问答,也从 22.9 上涨到 39.1。
在模型结构、参数量、总训练 token 完全持平的前提下,仅仅增加多模态混合预训练阶段,不管是文生图生成能力,还是视觉问答、多模态理解,全部获得巨大增益。
这也证明了:Multimodal Flow 这套基于超块(hyperchunk)的连续流框架,通过混合预训练确实学到了可迁移的语言‑视觉联合表征,不是单纯靠堆下游数据“硬记样本”。
这说明一件事:语言建模和图像生成在连续流框架里是互相促进的,不是互相挤占的。
同时,论文做了三组对比,结论都很扎实。
第一组,和公开 SOTA 比。
1.6B 的 MF-1 在 GenEval 上 82.8 分,超过 LWM(7B,0.47)、Show-o(13B,0.53)、Emu3-Gen(8B,0.61)等全离散模型,也超过 JanusFlow(1.3B,0.67)、D-DIT(2B,0.65)等混合模型。DPG-Bench 上 75.3 分,同样领先。
这些对手的参数量和训练数据普遍更大,MF-1是以小博大。
第二组,同预算受控对比。
在完全相同的数据、训练调度和可训练参数预算下,Multimodal Flow(全连续)、Transfusion 风格(混合)、Chameleon 风格(全离散)对比,而全连续路线在五项指标上全部第一,而且领先幅度不小。
这个数据把架构本身的优势就显现出来了。
第三组,缩放实验。
0.6B、1.2B、1.6B 三个版本当中,随着模型增大,语言建模 PPL 持续下降,GenEval 和 CLIPScore 持续提升,没有出现饱和迹象。这意味着连续流框架的缩放规律是健康的,更大的模型还有空间。
回到开头的问题:语言和图像该不该用同一套"token"?
Multimodal Flow 的回答是:不该用同一套token词元,但可以用同一条流。
离散 Token 化的根本问题,是把连续的视觉信号硬塞进离散的符号系统里,信息损失不可逆。混合路线虽然避开了量化,但两套目标函数意味着语言和视觉的生成过程本质上还是两件事,只是被拼在了一起。
Multimodal Flow 做的事情是:保留各自的表示空间,但用同一个连续生成过程把它们串起来。
语言和图像不再需要“翻译”,因为它们从一开始就在同一个流里运动。而这个思路的影响可能超出多模态本身。如果连续流可以统一语言和视觉,那音频、视频、动作呢?
论文在结论里明确提到,扩展到更长的交错序列、视频和其他结构化模态是未来方向。
当然,MF-1 只有 1.6B 参数,150B 预训练 Token,和 GPT-4o、Gemini 这种级别的模型还不在一个量级。全连续路线在超长序列、多轮交错对话场景下的表现还需要验证。
Flow Matching 的推理速度和离散自回归相比如何,也是个实际问题。但这篇论文的价值不在于“又刷了几个榜”,而在于它证明了一件事:
统一多模态建模不一定需要离散化,连续流是一条可行且有竞争力的路。
在整个行业都在往"大一统模型"冲的时候,余凯和王兴刚团队提出的研究,多了一条被验证过的技术路线,本身就是意义。
代码开源地址:github.com/hustvl/Multimodal-Flow
热门跟贴