来源:市场资讯

(来源:机器之心)

近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。

由于缺少充分的消融实验、可复现的训练配方和可以复用的数据配方,研究者往往很难判断优异的模型表现究竟是来源于哪里:是更优质的训练数据,还是某个特定的模型或训练设计?

如果存在一个性能出色,同时从训练代码到训练数据完全公开可复现的模型的话,研究者们就可以在统一起点上做更多拓展和控制消融实验,从而更准确地分析、理解不同设计带来的实际影响。

最近,普林斯顿大学刘壮团队发布的 i1 模型就回应了这一需求。

打开网易新闻 查看精彩图片

  • 论文标题:i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

  • 论文链接:https://arxiv.org/abs/2606.11289

  • 项目主页:https://zlab-princeton.github.io/i1/

  • 代码:https://github.com/zlab-princeton/i1

  • 模型:https://huggingface.co/zlab-princeton/i1-3B

  • 数据集:https://huggingface.co/datasets/zlab-princeton/i1-captions

团队开展了 300 多组控制实验,总计使用超过 70 万 TPU v6e 小时,系统研究了文生图扩散模型中的模型与数据设计。基于这些实验结论,他们最终训练出一个参数量为 3B 的文生图模型 i1。

在 GenEval、DPG-Bench、PRISM-Bench、CVTG-2K 和 LongText-Bench 五项基准上,i1 平均领先此前最好的全公开模型 29.5 个百分点。在这些主要关注提示词遵循和文字渲染能力的自动评测中,i1 的综合表现也接近部分参数量更大、仅开放权重的模型,如 20B 的 Qwen-Image。

打开网易新闻 查看精彩图片

五项文生图基准上的平均表现。i1 平均领先此前表现最好的全公开模型 29.5 个百分点,并接近多款仅开放权重的领先模型

i1 在通用图像生成任务上的精选示例
打开网易新闻 查看精彩图片
i1 在通用图像生成任务上的精选示例
i1 在文字渲染任务上的精选示例
打开网易新闻 查看精彩图片
i1 在文字渲染任务上的精选示例

控制实验

团队的探索基于一个简单且具有代表性的文生图基线:在模型方面,用浅层融合的方式由冻结的文本编码器提取特征,并输入到一个从头用 flow matching 训练的 DiT 网络;在数据方面,组合 12 个公开的图片数据集,并重新用 VLM 生成长 caption。

所有控制实验都从这个相同的 256×256 分辨率预训练基线出发,每次只改变一项设计,来评估不同模型和数据设计的影响。

i1 从一个统一基线出发,对一系列模型和数据设计开展控制实验
打开网易新闻 查看精彩图片
i1 从一个统一基线出发,对一系列模型和数据设计开展控制实验

在模型方面,团队的发现包括:

(1)同时使用多个文本编码器可以提升模型表现,但增大单个文本编码器的 adapter 也能获得类似效果,而且计算成本更低。

稍微增大文本编码器的 adapter 大小就能够在不同 backbone 上稳定提升表现
打开网易新闻 查看精彩图片
稍微增大文本编码器的 adapter 大小就能够在不同 backbone 上稳定提升表现

(2)AdaLN 占有大量参数,但用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益有限。

用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益十分有限
打开网易新闻 查看精彩图片
用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益十分有限

(3)在主干网络设计方面,相同参数量下,dual-stream 模型优于 single-stream 模型,single-stream 模型优于 cross-attention 模型。U-ViT 式的长跳跃连接在控制参数量或 FLOPs 时都能稳定提升性能。

控制参数的情况下,加入 U-ViT 式长跳跃连接能稳定提升表现
打开网易新闻 查看精彩图片
控制参数的情况下,加入 U-ViT 式长跳跃连接能稳定提升表现
控制参数的情况下,dual-stream 优于 single-stream 优于 cross-attention
打开网易新闻 查看精彩图片
控制参数的情况下,dual-stream 优于 single-stream 优于 cross-attention

在数据方面,团队的发现包括:

(1)在短 caption 上训练会整体削弱模型表现;而虽然长 caption 可以训出更强的模型,但这样的模型在短 prompt 上表现欠佳。推理时使用 prompt rewriter 扩写 prompt 可以弥补这一问题。

使用不同比例的长、短 caption 训练后,模型在不同类型的 prompt 上的表现
打开网易新闻 查看精彩图片
使用不同比例的长、短 caption 训练后,模型在不同类型的 prompt 上的表现

(2)数据集足够多样时,在较小规模的数据上重复训练不会严重影响文生图表现。

在数据集 subsample 到不同规模后,模型的表现
打开网易新闻 查看精彩图片
在数据集 subsample 到不同规模后,模型的表现

(3)高分辨率训练不需要广泛的 data coverage,也能保留甚至提升低分辨率训练阶段学到的能力(如文字渲染)。

打开网易新闻 查看精彩图片

仅保留特定数据子集进行 512×512 分辨率训练时的模型表现。即使不使用专门的文字渲染数据,模型的文字渲染能力仍能得到显著提升

最终的 i1 模型

打开网易新闻 查看精彩图片

i1 的整体模型框架。i1 没有引入复杂的新模块,而是组合了多项经过控制实验验证的简单设计

基于控制实验的结论,团队融合多项简单有效的设计,训练出 3B 参数的 i1。它在五项主流文生图基准上的综合表现接近多款参数量更大、仅开放权重的模型。i1 也是第一个能做到较准确的生成文字渲染的全公开模型,在 CVTG-2K 和 LongText-Bench 上分别得到了 0.8531 和 0.922 的分数。

i1 在文生图评测上的表现
打开网易新闻 查看精彩图片
i1 在文生图评测上的表现

总结

i1 表明,训练一个有竞争力的文生图模型并不一定依赖难以获取的私有数据、不透明的训练配方或复杂的模型组件:仅使用公开数据集,并基于经过系统控制实验验证的设计构建一个简洁的配方,同样可以在提示词遵循和文字渲染等能力上达到较强水平。

同时,i1 可复现的训练配方也给文生图研究提供了一个统一的起始点,使研究者能够在受控条件下评估新的模型或数据设计,更准确地理解不同改动真正带来的影响。

作者介绍

i1 第一作者曾博亚是普林斯顿大学一年级博士生,本科毕业于宾夕法尼亚大学,研究方向为视觉生成模型。

通讯作者刘壮是普林斯顿大学助理教授。他的研究致力于构建能够更好地感知和理解世界的 AI 系统,分析模型的工作原理,并使用 AI 加速科学研究。代表作包括 DenseNet、ConvNeXt,曾获 CVPR 最佳论文奖。