你有没有想过一个问题:AI画图模型学"怎么画一只猫"和学"怎么把这只猫的颜色改成白色",这两件事之间到底有没有关系?
按照过去几年大部分团队的做法,答案是没关系。文生图(T2I,也就是"文字生成图片")的数据是一套班子在弄,图像编辑的数据是另一套班子在弄,两边各自优化,各自堆数据,谁也不理谁。这就好比一个厨师专门练"切菜",另一个厨师专门练"炒菜",两人从来不交流,结果炒菜的师傅炒到红烧肉的时候,才发现自己根本不知道那块肉该切成什么形状最合适,因为切菜的经验从来没传给他。
阿里巴巴的这篇论文,恰恰是从这个被忽略的缝隙里,挖出了一个大问题:数据不应该按照"任务"来组织,而应该按照"能力"来组织。而能力之间是有依赖关系的,就像小孩先学会走路才能学跑步。这篇论文没有做出一个惊艳的新模型架构,它做的事情更基础也更笨重:重新设计整套数据基建,让不同能力之间能够"传帮带"。
问题出在哪儿:任务导向的数据组织方式,正在悄悄浪费数据
先说清楚困难在哪。
现在训练一个图像生成大模型,通常需要好几种数据:给文字生成图片用的图文对,给图像编辑用的"改前改后"配对图,还有让模型认识具体人物、地标、动植物的知识类数据。传统做法是,每一类数据独立构建、独立优化、独立评估,谁也不管谁。
这套逻辑听起来没什么问题,直到你意识到一件事:这些能力之间不是并列关系,而是有先后依赖的。
论文里举了个例子:文生图数据里学到的文字渲染能力(比如让AI画出一张写着"大甩卖"的海报,文字清晰可读),本可以直接迁移到图像编辑任务里去,让编辑模型也能处理带文字的图片。但如果两套数据各自为战、互不相通,编辑那边就得从零开始重新学一遍怎么写好文字,这不是重复劳动是什么?
这就好比一个连锁餐厅,总部研发出了一套完美的番茄酱配方,结果每个分店的厨师因为互相不通气,各自又花了三个月去调配一套自己的番茄酱,味道还不如总部的。信息本来是可以共享的,但组织架构没打通,导致了大量重复投入。
这不是一个小问题。论文观察到:不同的生成能力不是同时从零长出来的,它们有明确的先后顺序,这个顺序还恰好和模型训练的课程阶段高度吻合。
生成模型的能力发展有点像人学语言,先认字,再组词,再造句,最后才能写文章。如果一开始就让模型啃高难度的复杂结构图,它连基本的"猫是什么样子"都没搞明白,学习效率会非常低。
于是研究团队提出了两条并行的解决路径。第一条是"能力专属数据管线",把数据构建按目标能力拆成三个独立又互通的引擎。第二条是"能力对齐的课程调度",按照能力习得的先后顺序,动态调整训练数据的构成。这两条线拧在一起,就是这篇论文的核心贡献。
三个引擎各管一块,但共用一套"翻译语言"
论文把数据构建拆成三个专门的引擎:T2I数据引擎、图像编辑数据引擎、知识关联数据引擎。
**T2I数据引擎负责建立文字和图像之间的对应关系**
从一个数十亿规模的图片池子里,筛出4.4亿张高质量、语义均衡的训练图片。这个引擎干的活不只是"收集图片",更重要的是"填补空白"。
比如,团队特意去抓取那些专业设计师做的海报、网页截图、社交媒体图文、电商产品图,这些内容天然带有复杂的排版和文字信息,普通网络爬取的图文对里很少见。为什么要专门抓这些?因为这类结构复杂、信息密集的图像,是模型学会"排版能力"和"文字渲染能力"的关键素材,如果放任自然分布,这类图片占比太少,模型学不到。
更有意思的是一个反直觉的决定:团队没有把所有画质不好的照片都筛掉,而是刻意保留了一部分带瑕疵的图片,比如老照片、轻微失焦的图,同时在文字描述里明确写出它的缺陷(比如"画面有轻微噪点")。
这个做法乍一听有点浪费,过去的直觉是"垂直的糙照片就该扔掉"。但反过来想:如果模型从来没见过瑕疵长什么样,它怎么知道生成的时候要避开这些瑕疵?
这就像教一个新手厨师做菜,如果你只让他看完美摆盘的菜品照片,他永远不知道"糊了"是什么样子,更谈不上避免把菜炒糊。只有让他见过失败案例,并且明确指出"这是糊了",他才能在自己操作时主动避开。
**图像编辑数据引擎负责构造"改前改后"的配对样本**
这块最难,因为天然存在的编辑配对图特别稀缺,大部分团队的做法是靠合成生成,也就是用AI自己造训练数据。
但合成数据有个天生的缺陷:编辑效果容易显得"贴上去的",不像真实世界里那种自然、混合式的变化。
论文提出了三条并行的补充路径。
第一条叫"操作特定的配对构造",简单说就是:找一张已经完成的高质量图片,用VLM(视觉语言模型,一种能同时理解图片和文字的AI模型)和SAM3(一种能精确抠出图中物体轮廓的分割模型)识别出图中可编辑的对象,然后把这个对象删掉或替换,这样就得到了"改前"和"改后"两张图。反过来看,这个过程天然产生了添加、删除、替换、属性修改这四种编辑类型的配对样本。
第二条是"挖掘自然存在的关联图片",这是整篇论文我觉得最巧妙的一处设计。团队没有满足于合成数据,转而去网上、电商平台、社交媒体上找那些天然就是"一组"的图片。比如同一个人的不同状态照片、产品使用前后对比图、化妆前后的对照图、多图拼版里的不同区域。这些图片是真实世界里自然产生的,不是AI编出来的,所以编辑关系更真实、更复杂。
举个例子,电商平台上经常有那种"多宫格拼图",一张图分成四块,分别展示产品的正面、侧面、使用中、使用后。VLM可以把这张拼图拆开,识别出每一块之间的关系,直接变成一组高质量的编辑配对样本,完全不需要人工合成。
这个思路等于是说:既然真实世界本身就在不停地"编辑"和"记录变化",那为什么不直接从这些自然发生的记录里挖数据,而非要费劲去合成假的?如果只依赖合成数据,模型学到的编辑逻辑会偏向"套路化",遇到真实世界里那种自然、混合、不规则的变化要求时容易翻车。
第三条是"专家自蒸馏",针对特别稀缺的任务(比如虚拟试穿、美妆编辑),团队先用少量领域数据微调出一个"专家模型",再让这个专家模型批量生成候选样本,经过过滤后转化成大规模训练数据。这里还用到了视频生成模型(如Wan 2.2)来生成一些高难度编辑任务的可控样本。
整个编辑引擎最后攒出了1.2亿组编辑对,横跨单图编辑和多图编辑两大类任务,具体又细分成加减替换、风格转换、视角调整、文字排版编辑、修复复原等十几个子类。
**知识关联数据引擎负责让模型认得具体的人事物**
这个引擎的思路是从维基数据(Wikidata,一个开放的结构化知识库)出发,先用PageRank算法(一种衡量网络节点重要性的算法,最早用于谷歌网页排名)从超过一亿个实体里筛出概念上足够"有名"的候选,再让VLM进一步判断这个实体是否值得学、公众认知度够不够高,最终留下约300万个高显著度实体名称。
针对每个实体去网上抓配图,再用VLM做视觉核验,确保图片确实对应这个实体,而不是张冠李戴。最终整理出超过2700万组图像实体配对,覆盖名人、地标、动植物、知名IP这五大类。
这一步解决的是一个容易被忽视的问题:模型光会"画一只猫"是不够的,如果它连"大熊猫"和"埃菲尔铁塔"都认不出来,遇到需要具体知识的生成任务(比如"画一张巴黎埃菲尔铁塔前的野餐场景")就会露怯。
**三个引擎共用一套"语言"**
这是整篇论文设计上最值得说的一点:三个引擎各自独立运作,但它们统一使用同一种描述语言,由一套专门的图注模型来生成。
论文管这个叫"caption作为跨任务和跨粒度的桥梁"。具体来说,团队训练了一套VLM图注专家,把编辑指令的用词和描述结构,硬生生对齐到T2I图注的风格上去。
举个例子,如果T2I的图注习惯用"一位穿白色连衣裙的女性靠在木门前"这种描述方式,那编辑指令也会被改写成同样的用词习惯,而不是各写各的。这样一来,模型学到的"白色连衣裙"这个概念,在文生图任务里练出来的经验,就能直接复用到编辑任务里,不需要重新学一遍。
这就好比公司里所有部门统一用一套术语手册,财务部门说的"营收"和销售部门说的"营收"是同一个概念,不会因为部门不同就变成两种理解。如果没有这套统一语言,不同任务学到的知识就是碎片化的,互相之间无法迁移,等于白白浪费了本可以共享的经验。
图注系统本身也做得挺细,针对同一张图,会生成从实体标签、无序关键词、简短描述,到中长篇描述、超详细密集描述的多种粒度版本,还有中英双语版本。这样模型在训练时接触到的提示词风格更丰富,泛化能力更强。
对于编辑任务,团队还专门设计了一套"对齐"流程:先让图注模型不看原图,单独给目标图生成一份详尽描述,再对比原图和目标图找出差异,把目标图描述中和原图重复的部分替换成"[图1]"这种引用标记,只保留真正发生变化的部分作为文字描述。这样编辑指令就变得又准确又简洁,不会啰嗦地重复描述那些没有变化的内容。
训练顺序:不是一锅炖,是五道菜依次上
光有好数据还不够,论文的第二个核心贡献是"怎么喂"这些数据,也就是课程调度策略。
团队设计了五个训练阶段,从256像素的低分辨率一路走到1024像素的高清训练。
**第一阶段:256像素文生图预训练**
目标是最大化语义覆盖面,保留真实世界长尾分布的原始样貌。这里团队特意采用了比较宽松的过滤策略,不做激进的美学筛选,宁可留着一些"不完美"的图片,只要标注清楚它的缺陷即可。
**第二阶段:256到512像素的复杂内容预训练**
引入那些在低分辨率下根本学不明白的内容,比如密集文字排版、知识关联的图片。分辨率提升和内容复杂度提升是同步进行的,这个设计逻辑是:低分辨率下模型连基本轮廓都画不清楚,硬塞给它复杂结构等于白费功夫。
**第三阶段:512像素的文生图与编辑联合预训练**
这一步是关键节点。等文生图能力稳定之后,才开始引入编辑数据,让模型在已经积累的视觉概念基础上,学习"保留参考内容"和"受控变换"这两项编辑核心能力。
这个顺序安排背后的逻辑值得琢磨:如果编辑数据太早介入,模型连基本的视觉概念都没建立起来,编辑任务要求的"保留原图特征、只改变指定部分"这种精细控制根本无从谈起。
这就像教小孩临摹画之前,总得先让他认得笔怎么拿、颜料怎么调,如果直接让他去修改别人的画作,他连基本的绘画语言都不懂,改出来的东西只会是一团糟。
**第四阶段:512到1024像素的持续训练**
分辨率继续爬升,数据分布也从"广而杂"转向"干净且视觉质量更高"。这一步会把质量较差的网络爬取来源剔除,增加高保真度和专业视觉领域的采样比例。
**第五阶段:1024像素监督微调**
这是最后的精修阶段,用小规模但极度精选的数据集,引导模型走向一个视觉质量和指令遵循能力都更强的"子空间"。这里用到了VLM初筛加人工复核的双重把关,确保每一张进入最终训练集的图片都经得起挑剔的眼光。
整套课程设计还有个活的反馈机制,论文称之为"能力差距驱动的主动反馈闭环"。
具体流程是:每训练到一个阶段,就用AI生成图像模型自己去做能力评估,测试它在美学、文字渲染、指令遵循、空间准确性等各个维度上的表现。表现不达标的样本会被丢进"失败池",标注上具体的任务类型、语义标签和失败原因。
然后系统会拿这些失败案例当作检索种子,去找相似的补充数据,或者直接调用专家模型生成针对性样本。新补充进来的数据经过VLM初筛加人工复核,才会进入下一轮训练的采样池。持续失败的类别会被提高采样权重,已经解决的问题类别则会被降低权重,那些还没彻底解决的会被打回数据挖掘队列继续处理。
这套机制的价值在于:它把评估从一次性的"考试打分"变成了持续运转的"训练指挥棒"。
如果没有这个闭环,团队只能凭经验或者固定配方去猜测下一阶段该喂什么数据,很可能在模型已经学会的地方继续浪费资源,却在真正薄弱的地方投入不足。
结果说话:数据组织方式真的能带来能力上的提升吗
论文用两个规模的模型验证了这套方法,分别是30亿参数和60亿参数的多模态DiT模型(MM-DiT,一种基于扩散模型和Transformer结合的图像生成架构)。
在CPI-Bench(一个专门评测图像编辑能力的基准测试集)的两个子集上,模型表现如下。
| 模型 | 参数量 | CPI-General得分 | CPI-Practical得分 | 综合得分 |
| 60亿参数版本 | 6B | 3.96 | 3.92 | **3.94** |
| 30亿参数版本 | 3B | 3.95 | 3.91 | 3.93 |
分数是1到5分制,由VLM从多个维度打分。两个规模的模型表现都相当接近,说明这套数据基建方法本身的收益,不完全依赖堆参数量。
定性案例上,论文展示了几类比较刁钻的测试:混合式编辑(同时调整视角、材质、光照多个属性)、推理式编辑(比如"把这个场景恢复成四个月前的样子",这需要模型理解时间推理而不是简单的像素修改)、图像分割任务、老照片修复。团队还给出了和几个业界竞品(Qwen-Image-Edit、FireRed-Image-Edit、Flux.2-klein、JoyAI-Image-Edit)的直接对比图,从视觉效果上看,团队自己的模型在这几类复杂任务上表现更自然,编辑痕迹更不明显。
多图编辑的案例更有意思,比如把三张图里的人物、服装、场景元素组合成一张新图,模型需要准确识别每个"图N"引用对应的是哪个物体,并把对应属性绑定到正确位置。这背后依赖的正是前面提到的那套"统一语言"设计,如果图注和编辑指令没有对齐,模型很容易把不同来源的属性搞混。
写在后面
这篇论文让我意外的地方是,它没有去卷模型架构,也没有去卷参数规模,反而回头去啃一个大家都觉得"脏活累活"的问题:数据到底该怎么组织。
真正让我停下来想了想的是那个"故意保留瑕疵图片"的决定。这违反了一个我以为是常识的直觉,过滤数据不就该把差的都扔掉吗?但仔细想想,如果模型从没见过"糟糕"是什么样子,它连"避免糟糕"这个能力都学不会。这其实是个更普遍的道理:一个系统要学会"不做什么",前提是它得先见过"什么是不该做的"。这可能不止适用于图像生成,任何需要判断力的AI系统,大概都需要负样本的滋养。
另一个让我反复琢磨的点是"能力有先后依赖"这个判断本身。论文没有直接证明这一点,更多是基于观察和课程设计的实践结果反过来印证。但这提出了一个挺有意思的问题:如果能力之间真的存在类似人类学习的依赖链条,那我们是不是低估了训练顺序这个变量?现在大部分论文关注的是数据量和数据质量,训练的"顺序"这件事讨论得远远不够。
这套方法目前还没有解决一个问题:能力依赖的顺序,到底是模型架构决定的,还是数据本身的性质决定的?如果换一个完全不同的架构,这个五阶段课程是不是还成立?这个问题留着,可能得等下一篇论文来回答。
Q&A
Q1:这篇论文提出的能力驱动数据基建具体解决了什么问题?
A:解决的是传统数据管线里文生图、图像编辑、知识关联三类任务各自独立构建数据、互不共享的问题,导致同样的视觉概念要在每个任务里重复学一遍,浪费了本可以迁移的能力。
Q2:论文里的三个数据引擎分别是做什么的?
A:T2I数据引擎负责建立文字和图像的对应关系,构建了4.4亿图片的训练语料;图像编辑数据引擎通过操作构造、自然关联挖掘、专家蒸馏三条路径构建了1.2亿组编辑配对;知识关联数据引擎通过维基数据和PageRank筛选出高显著度实体,整理了超过2700万组图像实体配对。
Q3:为什么训练要分五个阶段进行,不能一次性把所有数据混在一起训练吗?
A:因为不同生成能力有先后依赖顺序,模型要先建立基本的视觉语义理解,才能学习复杂结构、知识关联和文字渲染,最后才适合引入图像编辑这种需要精细控制的任务,直接混在一起训练会导致模型在基础都不牢的情况下被迫学习高难度内容,效果反而更差。
热门跟贴