Training-Free Consistency Pipeline for Fashion Repose

无训练的一致性流程用于时尚姿态调整

https://www.arxiv.org/pdf/2501.13692

摘要
扩散模型的最新进展极大地拓展了对现实世界物体图像进行编辑的可能性。然而,执行非刚性变换(例如改变物体姿态或基于图像的条件控制)仍然具有挑战性。在这些编辑过程中保持物体身份的一致性十分困难,当前的方法往往难以满足工业应用中所需的精确度,而一致性在这些场景中至关重要。此外,微调扩散模型通常需要定制的训练数据,在实际场景中并不总是可获得的。本文提出了FASHIONREPOSE,这是一种无需训练、专为时尚行业设计的非刚性姿态编辑流程。该方法整合现成的模型来调整长袖衣物的姿态,同时保持服装的身份属性和品牌特征。FASHIONREPOSE 采用一种零样本的方式,在接近实时的情况下完成这些编辑,无需专门的训练。该方案在时尚行业及其他需要图像编辑中保持身份一致性的领域具有广泛的应用潜力。

1. 引言
时尚图像编辑在当今数字化和在线时尚产业中扮演着至关重要的角色,其应用涵盖电子商务、市场营销和设计等多个方面。灵活地调整图像——如更改服装的姿态、颜色或风格以适应不同受众和偏好——可以简化工作流程并提升客户体验 [29]。然而,对于基于人工智能的技术来说,非刚性变换(如姿态调整)仍然是一个挑战,尤其是在需要保持品牌一致性的身份保留任务中尤为困难。

传统的图形软件,如 Photoshop 和 Illustrator,长期以来被用于执行这类编辑,但它们劳动强度大且需要专业人员操作 [1, 4, 23]。随着人工智能(AI)与机器学习(ML)的发展,设计师能够创建虚拟的逼真样图,从而缩短产品设计周期,并加快决策过程,促进设计师、制造商和市场团队之间的协作 [35]。此外,AI 工具现在可以根据各种输入或算法实现图像编辑,大大减少了对手动干预的需求。这使得时尚品牌能够快速响应消费者需求、季节趋势以及不断变化的营销策略 [15]。

与此同时,消费者越来越期望获得个性化的体验——例如可视化一件衣服在不同颜色、不同体型上或不同场景中的效果。自动图像编辑工具和虚拟试穿技术能够提供定制化的服装视觉呈现,从而提升客户参与度和购物满意度 [11–13, 16]。因此,时尚零售商正在利用 AI 驱动的工具,在无需额外拍摄照片的前提下,将产品展示在不同的模特身上或多种配置中。尽管这些基于 AI 的编辑技术能够生成高质量的图像,但它们常常会引入服装外观上的细微变化。

尽管近年来人工智能(AI)和机器学习(ML)的进步自动化了部分图像编辑流程,提高了处理速度和适应性,但当前的解决方案在执行精确且保持身份一致性的编辑方面仍存在困难。例如,DDIM 逆变技术 [7, 30, 43] 可以估计生成真实世界图像的初始潜在噪声,但这些方法往往会修改服装的关键属性,使得身份一致性难以维持。此外,面对分布外(OOD)图像时,这些方法常常产生不一致的编辑结果 [2, 42, 47],限制了其在现实场景中的可靠性。

为应对这些挑战,我们将研究重点放在一个特定任务上:长袖服装的姿态调整(garment repose)或姿态归一化(pose normalization)。该任务使时尚品牌能够在保持服装身份与品牌特征的前提下,模拟服装重新摆放的效果。我们提出的方法FASHIONREPOSE提供了一种无需训练、支持零样本学习的一致性姿态归一化解决方案,采用多阶段流程,利用预训练模型完成编辑任务,无需专门训练。

我们的主要贡献可概括如下:

  • 我们设计并实现了一个无需训练、支持零样本学习的长袖服装姿态归一化流程,为工业应用提供高效且一致的姿态编辑方案。

  • 我们开发了一种用于识别和分割袖子与躯干区域的算法,提升了服装一致性的编辑精度。

  • 我们引入了一套品牌标志保留(logo-preservation)的工作流程,可在编辑过程中自动检测、抑制并重新整合品牌标志,以可扩展的方式维护品牌形象。

通过提供一种可扩展、高效且能保持身份一致性的图像编辑方案,FASHIONREPOSE在电子商务、时尚营销和设计原型制作中具有广泛的应用潜力,满足了行业对精准、灵活且身份一致的图像变换需求。

2. 相关工作
时尚图像生成与非刚性编辑
生成对抗网络(GANs)长期以来一直是图像生成任务的核心,能够实现逼真的操作,应用于面部属性编辑和复杂场景生成等领域 [14]。GANs 采用双网络结构,包括一个生成器和一个判别器,通过迭代提升图像质量,生成视觉上接近真实的照片级图像。然而,在需要进行非刚性变换(如改变服装姿态)的任务中,基于 GAN 的方法面临挑战,因为它们往往难以保持主体身份和视觉一致性。

概率扩散模型(Diffusion Models,DMs)代表了一种有前景的替代图像生成方法,通过迭代去噪过程生成图像,能够输出具有精细细节的高质量结果 [19]。在扩散模型用于可控图像生成方面的一个关键进展是条件控制技术的发展。这些方法允许对生成图像进行灵活控制,支持文本、草图或姿态等输入形式 [10, 32, 37, 50]。例如,Stable Diffusion 支持文本条件下的图像生成,这激发了其在时尚应用中的变体 [37]。近期的研究进一步扩展了这些能力,引入了图像条件模型如 ControlNet,该模型通过基于特定姿态或草图的条件控制实现姿态可控的图像生成 [52]。这类条件控制方法对于时尚图像编辑至关重要。

任务特定的一致性编辑
现代 GAN 和扩散模型能够生成高质量图像。然而,在需要非刚性变换的任务特定编辑中保持图像一致性仍是一个重大挑战。在这种情况下,保持主体身份的一致性尤为关键。GANs 可以在修改特定属性的同时保留其他属性不变 [31],但通常需要大量微调才能处理特定任务的编辑。扩散模型(DMs)引入了细粒度控制的灵活性,但将其适配到特定任务的图像编辑中通常需要专门的微调,例如低秩适配(LoRA),虽然提高了效率 [22],但仍需在目标数据集上重新训练。这种微调需求限制了实时编辑和适应能力,而这正是快节奏应用场景(如时尚产业)所必需的。

为应对这些局限,研究人员探索了多种 GAN 和 DM 的逆向技术,包括 GAN 逆向 [25, 33, 40, 48, 51, 54, 55] 和 DDIM/DPM 逆向 [20, 43],后者通过反向 U-Net 去噪过程估计 DM 中的初始随机噪声 [14, 38]。例如,“Null-Text Inversion” 通过执行关键逆向并结合“无文本优化”引导扩散模型实现一致的编辑,从而提高编辑保真度 [30]。其他方法尝试通过在逆向和重建过程中操控自注意力和跨注意力层来进行零样本编辑 [3, 8, 27]。

然而,尽管取得了这些进展,此类模型对文本提示或微调的依赖仍然限制了其在实际应用中任务特定图像编辑的适应性和可扩展性。文本提示虽然强大,但在对服装细节、身份保留和品牌特征进行精确控制时可能缺乏足够的表达力。此外,无论是基于 GAN 还是 DM 的方法,只要依赖微调或逆向过程,都会给时尚等行业带来不切实际的时间延迟,而这些行业迫切需要快速响应和实时适应能力。

考虑到这些方法的局限性,业界越来越需要一种无需训练、支持零样本学习的图像编辑流程,能够在接近实时的情况下实现高质量、一致且保留身份的编辑。我们提出的流程利用了最新的无需训练的技术 [18],为时尚图像编辑提供了解决方案,能够保留服装的身份属性和品牌特征。

通过消除对重新训练的需求,FASHIONREPOSE提供了一个可扩展的解决方案,非常适合对速度、身份、一致性与精度要求极高的应用场景。

3. 方法论

我们针对时尚领域中对零样本服装姿态归一化的需求,提出了FASHIONREPOSE,这是一种无需训练的流程,能够在复杂的非刚性变换中保留服装的身份属性和一致性。

3.1. 任务定义与动机任务定义

我们的目标是将长袖服装从初始松弛的手臂位置(“源姿态”或“静物姿态”)修改为标准化的45度手臂-躯干角度(“目标姿态”或“归一化姿态”),同时不改变图像中的其他元素(见图1):

  • 源姿态(或静物姿态):手臂自然下垂靠近身体、朝向地面的初始位置。
  • 目标姿态(或归一化姿态):手臂从躯干抬起呈45度角的理想配置。
动机

传统的姿态编辑模型需要大量的重新训练和大量标注数据,因此在实时、特定任务的应用中效率低下。这一限制在时尚行业中尤为突出,在该行业中,一致、快速且高质量的编辑至关重要。当前的扩散模型在姿态转换过程中往往会改变服装细节,如形状、颜色和纹理(见图9)。此外,现有数据集中缺乏特定服装的姿态变化样本,限制了特定领域模型的训练。

我们的方法通过一种无需训练的流程来填补这些空白,专为零样本、实时的服装姿态归一化设计,同时保持服装完整性,并解决遮挡问题,实现时尚领域的无缝、实用应用。

3.2. 流程架构

所提出的姿态归一化流程(见图2)处理一张长袖服装的输入图像,将其转换为归一化姿态,同时保留服装的颜色、纹理和品牌特征。该流程无需训练、支持零样本学习,可在接近一分钟内完成结果输出,包括以下阶段:

  1. 长袖检测:识别并过滤掉不含长袖服装的所有图像。
  2. 图像预处理:对输入图像进行预处理,并整合标志检测与抑制步骤。
  3. 粗略生成:使用预训练模型生成初步的归一化姿态服装图像。
  4. 条件去采样(Conditioned Unsampling):施加条件噪声,在潜在空间中调整服装特征。
  5. 源-目标形状匹配:使用掩码将生成的服装形状与原始图像对齐。
  6. 服装部件合成:将原始图像的躯干与编辑后的袖子合并。
  7. 上采样:使用4倍超清晰模型提升图像分辨率以增强质量。
  8. 标志检测、抑制与注入:恢复标志以在整个编辑过程中保留品牌形象。

每个阶段都有助于实现准确、视觉一致的编辑效果,并最大限度地缩短处理时间,这对于要求实时性与零样本一致性的时尚应用至关重要。

3.3. 长袖检测

长袖服装检测阶段是一个关键的预处理步骤,旨在过滤掉不含长袖上衣的图像。此过滤过程确保只有相关图像进入后续流程,优化整体效率。检测采用两步法完成:

  • 使用 VGG16 [41] CNN 模型,训练于 DressCode [17] 的一个子集;

  • 结合 Florence2 [49] 和 LLaMa3-8b [9] 进行辅助判断。

虽然这一步并非强制性,但它排除了非长袖服装,确保流程能顺利集成到现实工作流中。而执行实际编辑操作的后续阶段则无需训练,符合实现快速、零样本服装姿态编辑的目标。

3.4. 图像预处理

在预处理阶段,输入图像被缩放至512×5121024×1024像素两种尺寸:

  • 前者是为了适配 Realistic Vision 模型的数据集规格——这是一个基于真实人物、物体和场景训练的 Stable Diffusion 检查点;

  • 后者用于在流程各阶段保留更多服装细节。

每张输入图像必须满足以下要求,以便被正确处理:

  • 分辨率至少为1024 × 1024 像素,以避免在放大操作中出现低质量图像;

  • 宽高比为1:1,以避免在预处理过程中裁剪图像;

  • 服装背后的背景必须为清晰的纯白色

此外,在本阶段还会实施标志检测与抑制逻辑(详见第3.10节)。

3.5. 粗略生成

该阶段负责生成一个初步的、粗略的归一化姿态服装图像,以近似源图像中包含的细节(见图3)。该过程利用了多个预训练模型,如RealisticVision [37]ControlNet OpenPose [52]IP-Adapter Plus [50]

由于在初始静物姿态中,袖子的部分区域被躯干遮挡,因此有必要采用条件扩散模型来重建这些被遮挡的部分。然而,扩散模型在编辑过程中无法实现主体的完全一致性,导致最终图像中会出现一些变化。

3.6. 条件去采样(Conditioned Unsampling)

在这一阶段(见图4),我们采用了由正向与负向嵌入共同条件控制去采样技术。去采样过程包括:在特定时间步之前注入带有条件信息的噪声,并在后续的有条件采样过程中逐步去除该噪声。这一机制使我们能够沿着由正向和负向嵌入所指定的方向,在潜在空间中进行迁移。在我们的应用场景中,我们实现了从“袖子闭合”状态到“袖子展开”状态的过渡(见图4)。

为了强化目标姿态并保留原始服装的形状,我们同时利用了ControlNet OpenPoseControlNet Canny模型 [52]。
初始的潜在编码是通过对静物姿态和姿态归一化后的潜在表示进行梯度掩码融合操作获得的。

3.7. 源-目标形状匹配

由于生成的归一化姿态图像与原始静物姿态图像未能正确对齐,我们采用了一种形状匹配算法来调整缩放因子,以确保准确对齐(见图6)。

该算法以服装的源姿态和目标姿态的轮廓掩码作为输入。
缩放因子的计算基于躯干的一部分区域,其宽度为 b 、高度为 h (其中 b 为带宽,取30像素;h 为图像全高,512像素)。
通过使用边界框测量掩码中白色填充部分的高度,从而计算出缩放因子和偏移量。
随后,对图像进行缩放并合并在一起。

3.8. 服装部件合成

服装部件合成阶段是通过图像合成技术组装最终图像的关键步骤。
尽管在前一步骤中保留了服装的大部分特征,但在处理过程中仍可能发生一些变化。
因此,在本阶段,我们通过对静物图像中的躯干编辑后的袖子在像素空间中进行合成,进一步提升服装的身份一致性。
该算法识别图像中躯干和袖子所在的部分区域。
最后,利用获得的合成掩码将初始躯干与生成的袖子合并(见图5)。

该过程如算法1所示,其中 w 和 h 分别表示掩码的宽度和高度。

该方法的一个缺点是在合成连接线处可能出现硬边
为了解决这一问题,使最终图像更加统一,我们采用了轻量版的条件去采样流程(见第3.6节)。
最后,执行一次颜色重新校准过程,以恢复服装的原始色调。

3.9. 上采样

为了提升图像的整体质量,我们在流程中集成了一项最终的上采样阶段。
该模块使用4xUltrasharp 模型[45] 将图像分辨率从512×512 像素提升至1024×1024 像素

3.10. 标志检测、抑制与注入

为了更好地保留服装的身份属性,我们引入了一个标志恢复阶段
该阶段首先在初始静物图像中检测标志,在后续扩散任务中将其抑制,并在流程结束时重新注入(见图7)。

标志检测

在原始静物图像中检测标志对于在整个编辑过程中保持品牌形象至关重要。
为此,我们提出了一种基于Florence2SAM2的方法:

  • Florence2在图像中检测标志;
  • 并提供一个由SAM2使用的边界框,用于生成围绕标志的精确分割掩码。

标志抑制

标志抑制阶段依赖于从前一标志检测阶段提取的分割掩码。
所获得的掩码经过图像形态学膨胀预处理后,用作图像修复掩码,通过填充原始颜色或图案的方式从服装图像中去除标志。

标志注入

该阶段包括将姿态编辑后的服装图像与在标志检测阶段提取的标志进行掩码合成,实现标志的还原与融合。

4. 实验

在本节中,在对实验设置进行概述之后,我们从定量定性两个方面验证了所提出流程的有效性。此外,我们还对流程中的各个阶段进行了广泛的消融研究

4.1. 实验设置

所有实验均在一个配备NVIDIA RTX 4090 GPUCUDA 12.5和驱动版本555.52.04的工作站上进行。

我们使用IP-Adapter Plus [50]结合CLIP ViT-H/14 LAION-2B [5, 24, 34, 39],以实现强大的参考图像条件控制。

为了引导去采样和采样扩散过程,我们使用了ControlNet OpenPoseControlNet Canny [52] v1.1的生产模型,用于正向与负向条件控制。

在服装分割掩码生成方面,我们集成了Florence2 [49]SAM2 [36]

在标志检测任务中,我们使用了Florence2LLaMa3 Instruct 8b [9]

我们采用RealisticVision v5.1 [37]作为稳定扩散模型,并使用Karras 调度器 [26, 44]DPM++2M [28]作为确定性采样器(非随机微分方程)。

最后,在图像上采样任务中,我们使用了4x Ultrasharp v1.0 [45]上采样模型。

4.2. 定量评估

我们进行了全面的定量分析,以验证所提出方案的有效性(见表1)。

数据集

该流程在两个不同的时尚数据集上进行了评估:DressCode [17]VITON-HD [6],仅考虑上半身服装图像。
此外,我们还在 VITON-HD 的一个子集上进行了额外研究,该子集中仅包含带有品牌标志的上半身服装图像,以展示流程最后阶段的有效性。

基线方法

我们选取了以下方法作为对比基线:

  • MasaCtrl [3]
  • Null-text Inversion [30]
  • 无调优反转增强控制(Tuning-free Inversion-enhanced Control, TIC)[8]
  • 自由提示编辑(Free-Prompt-Editing, FPE)[27]
  • ControlNet [52]

其中,TIC 和 FPE 的架构是根据原始论文中的信息从头重新实现的。

评估指标

为了支持我们的研究,我们使用了多种定量指标 [21] 对比基线方法,包括:

  • 感知图像块相似度(LPIPS)[53]
  • 峰值信噪比(PSNR)
  • 结构相似性指数(SSIM)[46]

尽管当前最先进的模型在定量结果上表现更好,但它们无法完成姿态归一化的任务(见第4.3节)。
相比之下,我们提出的流程展示了更优的定性结果以及合理的定量指标。

通常来说,PSNR 和 SSIM 是评估图像重建质量的标准指标。
在本研究中,它们用于衡量修改后的输出在没有真实标签参考的情况下,保留源图像身份特征的程度。

4.3. 定性评估

图8展示了不同方法之间的定性比较。

我们的方法是唯一能够完成姿态归一化任务的方法,即使输入仅为服装的静物图像。
有关提示词的详细信息和更多示例,请参见补充材料。

4.4. 消融研究

我们对流程中不同阶段进行了全面的消融研究。
在表2中,我们总结了每个阶段在各项指标上的表现结果。

随着流程中各个阶段逐步加入,可以看到各项指标在部件合成阶段之前呈现出逐步提升的趋势
然而,在部件合成阶段标志恢复阶段之间,两个数据集上的性能都出现了下降

这种性能下降是由于最后一步操作引入了额外的噪声所致。
此外,DressCode 和 VITON-HD 数据集中带有品牌标志的服装数量较少,也对这一阶段的指标产生了负面影响。

因此,我们在 VITON-HD 的一个子集上进行了分析,该子集仅包含带有品牌标志的服装图像
结果显示,该子集的定量指标优于整个数据集的表现,进一步证明了我们流程的有效性。

流程各阶段的定性消融研究表明,随着图像在流程中逐步处理,服装的质量和身份一致性显著提升(见图9)。

更多示例请参见补充材料。

5. 结论与局限性

结论

在本研究中,我们提出了FASHIONREPOSE,一种全新的、无需训练的服装姿态归一化流程。该方法能够在长袖上装图像上执行非刚性编辑,实现在无需模型重新训练或微调的情况下进行接近实时的图像编辑。通过利用预训练模型多阶段架构,我们实现了对编辑过程的精确控制,同时保留了服装在形状、颜色色调和品牌标志等方面的一致性。
在多个数据集上的实验结果表明,该方法在姿态编辑过程中能够有效保持服装的身份属性和视觉特征。消融研究表明,流程中的每个阶段都对提升编辑图像的整体质量和一致性起到了积极作用。

局限性

尽管本研究取得了令人鼓舞的结果,但所提出的流程仍存在一些局限性(见图10):

  • 当服装具有复杂图案或纹理时,模型难以准确重建;

  • 合成掩码计算不准确的情况下,可能会引入一些伪影;

  • 具体而言,如果掩码与袖子位置未正确对齐,则可能出现伪影或白色空隙

未来的工作将包括:

  • 探索针对复杂图案的纹理重建方法

  • 减少生成中的伪影现象

  • 改进合成阶段的掩码生成机制

无需训练的一致性流程用于时尚姿态调整
补充材料

6. 概述

本补充材料提供了有关我们提出的FASHIONREPOSE流程的额外信息。具体而言,我们包含了更多的实现细节以及更多示例,以进一步验证我们的工作。

本补充材料的结构如下:

  • 额外实现细节:包含在基线方法和我们流程中所使用的文本提示的详细信息;
  • 额外定性示例:将我们的方法与其它最先进的基线方法进行比较,并展示更多定性结果;
  • 额外定性消融研究:展示流程中各个阶段在保持服装身份一致性方面的有效性,并提供更多定性示例。

7. 额外实现细节

本节详细描述了我们在研究中使用的提示(prompts),以便对生成结果进行精确控制。这些文本提示既用于基线方法,也用于我们流程中的不同阶段

7.1. 基线方法

为了评估FASHIONREPOSE的性能,我们将其实验结果与多种常用的文本到图像姿态到图像的基线方法进行了对比,包括:

  • MasaCtrl [3]
  • Null-Text Inversion [30]
  • 无调优反转增强控制(TIC)[8]
  • 自由提示编辑(FPE)[27]
  • ControlNet [52]

图11展示了用于文本到图像模型执行姿态编辑的任务特定结构化文本提示

实验表明,除了 ControlNet 之外,上述所有方法都无法实现有效的姿态变换(见图8)。此外,所有这些方法都会引入视觉伪影和非预期的修改,最终损害服装的一致性(详见第4.3节和第8节)。

7.2. 长袖检测

长袖服装检测阶段包含FASHIONREPOSE流程中的两个步骤,如第3.3节所述。

在长袖检测流程的第一步中,我们使用了一个基于VGG16 的卷积神经网络(CNN),该网络已针对识别长袖服装进行了微调。
选择 VGG16 是因为它在图像中有效捕捉视觉特征的能力已被证实,这对于将长袖服装与其他类型服装区分开来至关重要。

在训练过程中,该模型采用 RMSprop 优化器,准确率达到97%,优于其他架构,如 ResNet50(准确率 95%)和 InceptionV3(准确率 94%)。
此检测步骤用于过滤掉非长袖服装(即短袖或无袖服装),确保只有相关图像进入流程的后续阶段。

重要的是,这一步骤的设计旨在无缝集成到现有行业工作流程中(如第3.1节所述)。
这种与操作流程的一致性确保了该流程不仅保持技术上的高效性,还满足了实际应用中对可扩展性和部署性的需求。

在此步骤中,我们使用文本提示进一步细化对长袖服装的识别过程。
这个额外的过滤阶段保证了只有相关的服装图像进入流程的后续阶段,从而提高了检测的可靠性并降低了误报率。

该阶段利用了预训练模型Florence2 [49]LLaMa3-8b [9]

  • Florence2

    生成一个详细描述静物服装的标题(关于“静物”的定义见第3.1节),包括袖型、纹理和整体服装结构等属性;

  • 所生成的标题随后由LLaMa3(Meta 开发的一个开源大语言模型 LLM)处理,以检测并准确区分长袖与非长袖图像。

为了使大语言模型能够判断图像中的服装是否为长袖,我们采用了一种字符串拼接方式:将一段引导语(preamble)与 Florence2 生成的详细描述拼接在一起输入模型(见图12)。

7.3. 标志检测与抑制

标志检测阶段和标志抑制阶段在流程的第3.10节中已介绍并描述。

标志检测

该阶段结合了Florence2SAM2 [36]的能力,分别用于定位生成精确的标志分割掩码

具体而言,Florence2使用一个有针对性的文本描述,通过结构化的文本提示(见图13)来引导在服装图像中的定位过程。

该任务指示 Florence2 识别提示中指定的所有项目。随后进行一个过滤操作,仅保留图像中包含检测到的标志的区域(即边界框)。

在定位完成后,SAM2被用于为检测到的标志生成精确的分割掩码
Florence2 提供的边界框作为 SAM2 的输入,后者将其细化为准确描绘标志轮廓的分割掩码。

标志抑制

标志抑制阶段旨在消除品牌标志,同时确保服装的视觉完整性不受影响。
利用在检测阶段获得的分割掩码,该过程通过正向提示负向提示共同驱动(见图14),以实现对初始图像中标志的精确去除

该提示的目的是引导Realistic Vision模型进行图像修复,优先保证标志背后服装纹理和色彩属性的连续性
具体来说,它确保修复过程使用均匀的纹理重建标志区域,使其与周围材质无缝融合,从而保持服装的视觉一致性。

相比之下,负向提示用于明确防止生成多余或视觉干扰元素
通过将这些元素定义为不希望出现的内容,模型可以专注于生成一个干净、无标志、与服装其余部分无缝融合的表面。

7.4. 条件去采样

条件去采样阶段是精炼服装姿态变换的关键步骤,旨在确保服装身份和视觉保真度的一致性(见第3.6节)。

在该阶段中,我们通过注入条件噪声来调制潜在空间中的服装特征,从而在保留服装特定属性的同时,实现与目标姿态的精确对齐

为了实现这一目标,我们使用正向提示负向提示的组合,有效地引导模型的去采样过程(见图15):

  • 正向提示采用由Florence2生成的详细描述文本。
    该描述有助于告知模型在整个编辑过程中哪些特征必须保留

  • 同时,负向提示用于防止在去采样阶段生成不希望出现的特征
    负向提示的结构遵循Realistic Vision作者的指导原则,
    明确排除如变形的身体部位低质量渲染不真实的效果等不理想的特征。

这种有针对性的方法确保了去采样过程专注于优化姿态变换,同时保持服装的真实外观

8. 额外定性示例

在本节中,我们提供了更多定性示例,以展示FASHIONREPOSE流程在实现服装姿态归一化方面的一致性和有效性。这些示例表明,我们的方法在将服装从初始姿态转换为标准化姿态的过程中,能够保留服装的身份特征、纹理细节和品牌属性。图中展示了FASHIONREPOSE与多种最先进的基线方法之间的对比,包括:

  • MasaCtrl [3]
  • Null-Text Inversion [30]
  • 无调优反转增强控制(TIC)[8]
  • 自由提示编辑(FPE)[27]
  • ControlNet [52]
图16:DressCode 数据集上的比较

该图展示了基于DressCode [17]数据集的服装样本对比结果。实验显示,FASHIONREPOSE 能够准确地重新定位服装袖子,同时保持一致的纹理和颜色,这在第一行和第三行的结果中尤为明显。

相比之下,各基线方法表现出不同程度的问题,如袖子形状扭曲、纹理不一致和颜色偏移,特别是MasaCtrlNull-Text Inversion的结果更为明显。

图17:VITON-HD 数据集上的扩展比较

该图将比较扩展至VITON-HD [6]数据集,突出了 FASHIONREPOSE 在更广泛服装图像上的一致性与准确性

在第一个示例中,除了我们的方法之外,只有TIC成功重建了原始纹理,但它未能正确调整袖子的位置。

图18:带标志服装的处理效果

图18 聚焦于带有品牌标志的服装,使用的是 VITON-HD 数据集的一个子集。结果显示,我们的流程不仅能够有效地进行姿态归一化,还能高保真地抑制并重新注入标志,从而确保品牌形象的一致性得以维持。

9. 额外定性消融研究

本节提供了更多定性示例,以展示流程中每个阶段对最终输出质量的贡献。

以下图表突出了流程中各个阶段对结果的影响。

图19:DressCode 数据集上的消融研究

该图展示了在DressCode [17]数据集上进行的消融研究,说明了FASHIONREPOSE流程中每个阶段的作用。
从粗略生成开始,后续每一个阶段——包括条件去采样部件合成标志恢复——都展示了其在提升服装身份特征和视觉一致性方面的重要作用。

随着新阶段的引入,服装特征的保留和伪影的减少均有显著改善,进一步强调了流程中每一环节对于实现高质量姿态归一化的必要性:

  • 条件去采样(c)

    提升了服装身份细节,并减少了粗略生成(b)中可能存在的伪影;

  • 部件合成阶段(d)

    增强了服装结构的整体性;

  • 标志恢复(e)

    成功将品牌标志重新注入图像,且未引入明显不一致的问题。

图20:VITON-HD 数据集上的消融研究

该图展示了在VITON-HD [6]数据集上进行的消融研究,进一步验证了前述观察结论。

图21:针对带标志服装的消融研究

图21 展示了一项专注于带有品牌标志服装的消融研究,使用的是 VITON-HD 数据集的一个子集。
从粗略生成到标志恢复的整个流程清晰地展示了标志处理流程在实现连贯、身份保留编辑中的关键作用。

https://www.arxiv.org/pdf/2501.13692