近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
由于缺少充分的消融实验、可复现的训练配方和可以复用的数据配方,研究者往往很难判断优异的模型表现究竟是来源于哪里:是更优质的训练数据,还是某个特定的模型或训练设计?
如果存在一个性能出色,同时从训练代码到训练数据完全公开可复现的模型的话,研究者们就可以在统一起点上做更多拓展和控制消融实验,从而更准确地分析、理解不同设计带来的实际影响。
最近,普林斯顿大学刘壮团队发布的 i1 模型就回应了这一需求。
- 论文标题:i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models
- 论文链接:https://arxiv.org/abs/2606.11289
- 项目主页:https://zlab-princeton.github.io/i1/
- 代码:https://github.com/zlab-princeton/i1
- 模型:https://huggingface.co/zlab-princeton/i1-3B
- 数据集:https://huggingface.co/datasets/zlab-princeton/i1-captions
团队开展了 300 多组控制实验,总计使用超过 70 万 TPU v6e 小时,系统研究了文生图扩散模型中的模型与数据设计。基于这些实验结论,他们最终训练出一个参数量为 3B 的文生图模型 i1。
在 GenEval、DPG-Bench、PRISM-Bench、CVTG-2K 和 LongText-Bench 五项基准上,i1 平均领先此前最好的全公开模型 29.5 个百分点。在这些主要关注提示词遵循和文字渲染能力的自动评测中,i1 的综合表现也接近部分参数量更大、仅开放权重的模型,如 20B 的 Qwen-Image。
五项文生图基准上的平均表现。i1 平均领先此前表现最好的全公开模型 29.5 个百分点,并接近多款仅开放权重的领先模型
i1 在通用图像生成任务上的精选示例
i1 在文字渲染任务上的精选示例
团队的探索基于一个简单且具有代表性的文生图基线:在模型方面,用浅层融合的方式由冻结的文本编码器提取特征,并输入到一个从头用 flow matching 训练的 DiT 网络;在数据方面,组合 12 个公开的图片数据集,并重新用 VLM 生成长 caption。
所有控制实验都从这个相同的 256×256 分辨率预训练基线出发,每次只改变一项设计,来评估不同模型和数据设计的影响。
i1 从一个统一基线出发,对一系列模型和数据设计开展控制实验
在模型方面,团队的发现包括:
(1)同时使用多个文本编码器可以提升模型表现,但增大单个文本编码器的 adapter 也能获得类似效果,而且计算成本更低。
稍微增大文本编码器的 adapter 大小就能够在不同 backbone 上稳定提升表现
(2)AdaLN 占有大量参数,但用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益有限。
用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益十分有限
(3)在主干网络设计方面,相同参数量下,dual-stream 模型优于 single-stream 模型,single-stream 模型优于 cross-attention 模型。U-ViT 式的长跳跃连接在控制参数量或 FLOPs 时都能稳定提升性能。
控制参数的情况下,加入 U-ViT 式长跳跃连接能稳定提升表现
控制参数的情况下,dual-stream 优于 single-stream 优于 cross-attention
在数据方面,团队的发现包括:
(1)在短 caption 上训练会整体削弱模型表现;而虽然长 caption 可以训出更强的模型,但这样的模型在短 prompt 上表现欠佳。推理时使用 prompt rewriter 扩写 prompt 可以弥补这一问题。
使用不同比例的长、短 caption 训练后,模型在不同类型的 prompt 上的表现
(2)数据集足够多样时,在较小规模的数据上重复训练不会严重影响文生图表现。
在数据集 subsample 到不同规模后,模型的表现
(3)高分辨率训练不需要广泛的 data coverage,也能保留甚至提升低分辨率训练阶段学到的能力(如文字渲染)。
仅保留特定数据子集进行 512×512 分辨率训练时的模型表现。即使不使用专门的文字渲染数据,模型的文字渲染能力仍能得到显著提升
最终的 i1 模型
i1 的整体模型框架。i1 没有引入复杂的新模块,而是组合了多项经过控制实验验证的简单设计
基于控制实验的结论,团队融合多项简单有效的设计,训练出 3B 参数的 i1。它在五项主流文生图基准上的综合表现接近多款参数量更大、仅开放权重的模型。i1 也是第一个能做到较准确的生成文字渲染的全公开模型,在 CVTG-2K 和 LongText-Bench 上分别得到了 0.8531 和 0.922 的分数。
i1 在文生图评测上的表现
总结
i1 表明,训练一个有竞争力的文生图模型并不一定依赖难以获取的私有数据、不透明的训练配方或复杂的模型组件:仅使用公开数据集,并基于经过系统控制实验验证的设计构建一个简洁的配方,同样可以在提示词遵循和文字渲染等能力上达到较强水平。
同时,i1 可复现的训练配方也给文生图研究提供了一个统一的起始点,使研究者能够在受控条件下评估新的模型或数据设计,更准确地理解不同改动真正带来的影响。
作者介绍
i1 第一作者曾博亚是普林斯顿大学一年级博士生,本科毕业于宾夕法尼亚大学,研究方向为视觉生成模型。
通讯作者刘壮是普林斯顿大学助理教授。他的研究致力于构建能够更好地感知和理解世界的 AI 系统,分析模型的工作原理,并使用 AI 加速科学研究。代表作包括 DenseNet、ConvNeXt,曾获 CVPR 最佳论文奖。
热门跟贴