来源:市场资讯

(来源:科技行者)

打开网易新闻 查看精彩图片

这项由韩国CLO Virtual Fashion公司研发团队完成的研究,以arXiv预印本形式发布于2026年7月15日,编号为arXiv:2607.13365。有兴趣深入了解技术细节的读者可通过该编号查询完整论文。

**现实中的一道难题**

你有没有想过,为什么网上买的衣服,试穿时总是和商品图有那么大的差异?部分原因就在于,数字世界里真实还原一件衣服的立体形态,比你以为的要难得多。

现在的3D建模技术,就像是用大量积木堆出一件衣服的样子——但衣服本身是薄薄的一层布料,而积木天然是有体积的方块。用方块去堆一张纸,结果要么是纸变得厚实笨重,要么边缘锯齿感明显,完全失去了薄如蝉翼的轻盈感。主流的3D生成技术绕不开这个根本矛盾:它们天生就擅长生成"封闭的、有厚度的"物体,比如一个苹果、一辆汽车,但面对衬衫的领口、裙子的荷叶边、夹克的拉链这类薄薄的、边缘开放的结构时,就力不从心了。

CLO Virtual Fashion的研究团队把这个问题彻底翻新了一遍,提出了一套叫做"可微分几何图像"(DiffGI,Differentiable Geometry Image)的方法,专门为薄壳结构量身定制,让计算机第一次能够以接近人类裁缝理解布料的方式,来生成和还原3D服装。

一、为什么现有技术面对衣服总是"碰壁"

回到积木的比喻。主流3D生成技术的核心思路,是把整个三维空间切成无数个小格子,就像一个立体的棋盘,然后判断每个小格子里有没有物体。这种方法对苹果、椅子、雕塑这类"实心"物体效果很好,因为物体本身就有体积,能填满那些格子。

但衬衫不是苹果。衬衫是一张弯曲的、开放边界的薄面,厚度接近于零。当你用"立体棋盘"去描述衬衫时,就相当于用方格纸去剪一个圆——边缘永远是一圈锯齿,而不是光滑的曲线。分辨率越低,锯齿越明显。很多技术不得不把分辨率提得非常高,比如一种叫GIMDiffusion的方法需要用768×768的网格才能勉强压制锯齿,但这样计算量就大得惊人。

更根本的问题在于,这些技术的"边界判断"是一刀切的:一个格子,要么是"有",要么是"没有",没有中间状态。这就好比你用黑白两色的马赛克去拼一幅画,颜色只有纯黑和纯白,却要表达灰色渐变的头发——无论怎么努力,结果都是粗糙的。当系统需要把高分辨率的"黑白图"压缩成小图来加速训练时,灰色的边界信息就彻底丢失了。

还有一个更隐蔽的问题:就算技术能生成一个粗糙的3D形状,最终从数字信号"翻译"成真正的3D网格模型这一步,也是硬切的、不可逆的,就像把一张手绘稿扫描进电脑之后,电脑无法再反过来修改铅笔线条。这导致整个学习过程是"断链"的——AI在学习时,无法从3D结果的好坏反过来调整自己的判断。

二、新思路:用"距离感"代替"有或没有"

DiffGI的核心突破,是把描述边界的方式从"是/否"换成了"距离"。

具体来说,研究团队不再用0或1的黑白格子来标记衣服的轮廓,而是给每个格子赋予一个数字,这个数字代表"离最近的轮廓线有多远"。在衣服内部,这个数字是正数,代表距离边界的像素数量;在衣服外部,这个数字是负数;恰好在边界上,这个数字就是0。这种表示方法有一个学术名字叫"截断有符号距离函数"(TSDF,Truncated Signed Distance Function),但理解它的关键只是一件事:连续的数字比硬切的黑白格子,能保留多得多的信息。

可以这样理解这种区别:用黑白格子描述边界,就像告诉你"这里有一扇门",你只知道门在大概这个位置;用距离数字描述边界,就像告诉你"门框的左侧距离你3厘米",精度精确到厘米级,甚至毫米级。

这种精度上的提升有多显著?研究团队做了一个对比实验:在不压缩的情况下,当分辨率低至64×64时,TSDF方式的重建误差(用豪斯多夫距离衡量)明显低于黑白格子方式;到了128×128时,差距依然显著。只有当分辨率提高到256×256以上,两种方式才逐渐趋近。换句话说,用距离数字来描述边界,可以用更低的分辨率达到更高的重建质量——这直接意味着更少的计算量、更快的速度。

对于服装这类边界复杂的物体,TSDF的优势更加突出。衣服有密集的褶皱、弯曲的下摆、不规则的开口,这些地方边界极度密集。黑白格子遇到这种复杂边界就会产生大量锯齿;而距离数字在相邻格子之间平滑过渡,天然适合描述这种弯曲绵延的轮廓。

三、让3D重建也能"学习":可微分的马奇方块算法

解决了"怎么描述形状"的问题,DiffGI面对的下一个挑战是:怎么让AI从这个描述中把真正的3D网格"搭建"出来,同时让这个搭建过程能够被"指导"和"纠错"?

传统的方法——无论是从3D格子里提取面片的Marching Cubes,还是类似的2D版本——都是用"查表"的方式工作的。给定几个格子的值,查一张预设的规则表,决定在哪里放一条线或一个面。这种查表操作本质上是跳跃式的、不连续的,就像走楼梯而不是走坡道:你无法在楼梯上找到"半步",自然也就无法把"楼梯走得好不好"这个评价,传递回去告诉腿该怎么迈。

DiffGI引入了"可微分马奇方块"(DMS,Differentiable Marching Squares)算法,把这个过程改成了"坡道"。

具体原理是这样的:当两个相邻格子里,一个距离值是正数,一个是负数,说明边界就在它们之间。边界的精确位置,可以用两个格子的数值按比例插值来计算。比如左边格子的距离是+3,右边是-1,那么边界就在离左边格子75%、离右边格子25%的地方。这是一个连续、平滑的数学运算,没有任何跳跃,就像走坡道一样。

为了防止两个格子数值非常接近时(分母趋近于零)计算出现不稳定,研究团队还加入了一个极小的稳定常数(约百万分之一)来保护计算精度,同时确保这个常数不干扰反向传播时的梯度流动。

有了这个连续的坡道,AI在训练时就可以做到:先从2D的距离图生成3D网格,然后把这个3D网格的好坏(比如表面法线是否准确、形状是否忠实)换算成一个"评分",再把这个评分通过数学链条,一路追溯回去,告诉2D图上每一个数字该往哪个方向调整。这就像一个厨师不仅能品尝到菜是否好吃,还能精确知道少放了多少盐、火候差了几分钟,从而不断改进。

研究团队还考虑了一个特殊情况:在马奇方块算法的16种拓扑形态中,有两种(对角格子的值一正一负的情形)在数学上存在歧义——两种连法都说得通。团队的做法是统一规定把这两块当作互不相连的独立区域处理,虽然选择本身是固定的,但选择后边界顶点的坐标依然是连续计算的,所以梯度依然能够正常流动。

从计算效率上看,这个方法工作在2D网格上,计算量随格子数量的平方增长;而传统的3D体积方法计算量随立方增长。以相同的精度要求,DMS大约比DMTet等3D方法快得多,内存占用也显著更少。

四、把复杂3D服装压缩进一张名片大小的"密码"

有了连续的距离图和可微分的重建算法,研究团队开始搭建整个生成系统的核心——DiffGI-VAE。

VAE(变分自编码器)是一种特殊的神经网络,可以把复杂的信息压缩成一段简短的"密码",也可以从密码重新展开还原信息。这个思路有点像把一部长篇小说压缩成几百字的内容简介,然后再从简介反推出故事细节——当然,这种还原不可能完美,但如果"密码"设计得足够聪明,关键信息是可以保留下来的。

DiffGI的输入是一个256×256×4的图像张量(三个通道存3D坐标,一个通道存距离值),目标是把它压缩成32×32×4的潜在表示——也就是把信息压缩到原来的八分之一分辨率。这是极为激进的压缩,相当于把一张高清照片缩成略缩图,然后要求从略缩图还原高清细节。

为了让这个高度压缩的"密码"仍然保留3D形状的精华,研究团队设计了一个三管齐下的损失函数(可以理解为"评分系统")。第一管是位置图的像素级误差,确保每个像素的3D坐标大体正确;第二管是距离图的像素级误差,确保边界信息被正确还原;第三管是最关键也最有创新性的——"法线渲染损失"。

所谓法线,是3D表面上每个点"朝向哪里"的信息。如果你把一件衬衫看成是无数个微小平面的集合,每个小平面都有一个朝向,这就是法线。法线信息对视觉质量至关重要:同样形状的表面,法线正确的话看起来就是光滑流畅的布料,法线混乱的话就会呈现出奇怪的噪点和折痕。

传统的像素级损失无法有效监督法线——就算每个像素的坐标都差不多对,相邻像素之间微小的错位也可能导致局部法线严重扭曲,产生肉眼可见的噪点。法线渲染损失的做法是:把重建出的3D网格从四个固定角度渲染成法线图,再与真实网格的法线图比较差异,把差异换算成损失信号,通过可微分的马奇方块算法,一路追溯回去影响VAE的权重更新。这条路径的成立,完全依赖于DMS提供的连续可微分通道。

为了加速训练,研究团队还采用了一个聪明的起跑策略:用已经在海量自然图片上训练好的Stable Diffusion 1.5的VAE权重来初始化,同时把第一层卷积的通道数扩展以适应4通道输入,新增的权重用零初始化以防止已有知识被破坏。消融实验证明,这个预训练初始化只是加速了收敛过程,最终的重建质量与从头训练相比几乎没有区别——说明DiffGI的性能提升真正来自于表示方法和训练目标的设计,而不是借了预训练的东风。

五、在"密码空间"里学会创造新服装

有了把3D服装压缩成32×32×4密码的能力,研究团队的下一步是训练一个能在这个密码空间里"创作"的生成模型——也就是从无到有,或者根据一张图片、一个草图,生成全新的3D服装。

这类生成模型的主流架构之一叫做扩散模型(Diffusion Model):它先往真实数据里逐步加噪声,把"真实"变成"随机乱码",然后反过来学习从"乱码"恢复"真实"的过程。训练完成后,就可以从纯随机乱码出发,一步步去噪,最终生成新的"真实"密码,再解码还原成3D网格。

研究团队没有使用常见的U-Net架构,而是选择了Diffusion Transformer(DiT)作为核心骨架。这个选择背后有一个理由:服装的UV图(把3D表面展开成2D平铺图)不像自然图片那样有明显的局部空间规律——相距很远的两块布料在展开图上可能紧挨着,而在展开图上相邻的两块区域在3D空间里可能完全不相干。Transformer架构能让所有位置两两之间互相"对话",非常适合捕捉这种全局拓扑关系。此外,扩散模型采用了流匹配(Flow Matching)调度方案,这种方案能用更少的去噪步骤生成高质量结果,进一步加快推理速度。

研究团队基于这套框架搭建了三种不同的生成模式,分别服务于不同的使用场景。

第一种是"类别条件生成",给AI一个类别标签(比如"椅子"或"台灯"),它就能生成对应的3D模型。这种模式使用了DiT-B/2(中等规模)架构,在ABO家具数据集上训练,涵盖椅子、台灯、沙发、桌子四类。

第二种是"图片条件生成",给AI一张衣服的正面照片(渲染的法线图),它能推断出看不见的背面,生成完整的3D服装。这种模式使用了更大的DiT-L/2架构,并通过一种叫DINOv2-Large的视觉特征提取器把图片信息注入到生成过程中。令人惊喜的是,尽管训练时用的是渲染法线图,在测试时用真实衣服照片也能工作,表现出一定的泛化能力。

第三种是"占位条件生成",给AI一张2D的缝纫版型轮廓图(相当于裁缝的裁剪样板),AI就能生成穿着在身上的3D褶皱效果。由于版型本身已经高度约束了形状,研究团队换用了更轻量的UNet-Tiny架构,计算量大幅降低。更有趣的是,如果你在版型上只修改袖子部分,生成出的3D模型也只有袖子部分发生变化,其余形态保持一致,实现了精准的局部编辑效果。

为了解决UV展开图布局固定导致的位置偏差问题,研究团队还设计了一套数据增强方法:把同一个3D网格重新排列成不同的2D布局,这样一件衣服就能变成多种不同的训练样本。在ABO数据集的3800个样本基础上,通过这种方式扩充到了50万个训练样本,足以支撑更大规模的模型稳定训练。

六、实验数据说明了什么

研究团队在两个数据集上进行了系统评估:ABO数据集包含约7900个商业3D家具扫描模型(椅子、台灯、沙发、桌子等),GarmageSet数据集包含约14801个物理仿真级别的3D服装模型(具有大量非流形特征)。另外还用了约300张真实服装照片的WARDROBE数据集做零样本泛化测试,但这个数据集不参与定量评测。

定量评测使用了多个指标。倒角距离(CD)衡量生成形状与真实形状之间的整体差距;法线一致性(NC)衡量表面朝向的准确程度;F1分数衡量形状的精确率和召回率;边界倒角距离(BCD)专门衡量开放边界的精确程度(这是衡量薄壳结构最直接的指标);豪斯多夫距离(HD)衡量最坏情况下的局部偏差。

在VAE重建质量方面,DiffGI与两个基线方法进行比较:Omages直接在64×64×4的几何图像上操作,不经过VAE压缩;GarmageNet使用逐面板的几何图像(因此无法应用于家具数据集)。结果显示,DiffGI用32×32×4的压缩密码,在家具和服装两个数据集上的倒角距离和地球移动距离(EMD)等指标均优于Omages直接操作64×64×4不压缩的版本。换句话说,DiffGI把信息压得更小,表现却更好。唯一的例外是在ABO家具数据集上的法线一致性,DiffGI的NC略低于Omages,研究团队认为这是因为家具形状多为平面,Omages不压缩直接保留了更多法线细节;而在服装这类复杂曲面上,DiffGI的NC反而更高。

消融实验(逐步关闭各个设计组件,观察性能变化)清晰地展示了每个设计决策的贡献。单纯把占位图换成TSDF,不加法线损失,倒角距离就从1.503×10??降到0.595×10??,降幅超过六成,这是表示方法本身带来的收益。在此基础上加入法线损失,倒角距离进一步降至0.461×10??,法线一致性从0.921升至0.961。有一个有趣的细节:仅用占位图+法线损失组合,法线一致性能达到0.947,超过了TSDF无法线损失的0.921——这说明法线损失足够强力,能在一定程度上弥补占位图的边界模糊问题;但在倒角距离、地球移动距离等整体形状指标上,TSDF无法线损失仍然领先于占位图+法线损失,证明表示方法是更基础性的因素。

在3D生成任务上,与TRELLIS、TRELLIS.2等大型基础模型的对比显示,DiffGI在服装生成的精确度上更胜一筹——倒角距离1.35×10??对比TRELLIS的3.44×10??,F1分数0.48对比TRELLIS的0.28,边界倒角距离2.91×10??远低于TRELLIS.2的12.44×10??,同时顶点数量只有约2.3万,而TRELLIS有10.9万、TRELLIS.2有38万。当然,TRELLIS是通用大模型,DiffGI是专为服装优化的专项模型,两者的定位不同;研究团队也明确表示这个对比的目的是展示薄壳结构专用方案的优势,而非声称全面超越。TRELLIS在服装生成上产生的常见问题是"双层壁"——前后两层布料被当成了封闭物体,中间生成了不合理的厚度;这是所有假设封闭表面的方法的根本缺陷。

计算效率方面的对比相当惊人。TRELLIS推理一次需要约16.28GB显存、4.52秒;Omages需要52秒。DiffGI的图片条件生成版本在RTX A6000上只需3.22GB显存、0.80秒,在消费级的RTX 4070显卡(12GB)上需要1.21秒,甚至在苹果M4芯片的MacBook上纯CPU运行也只需8.52秒。这意味着DiffGI已经可以在没有专业显卡的普通笔记本上运行。

七、这套方法还不完美的地方

DiffGI的局限性主要体现在三个方面,研究团队在论文中坦诚地进行了说明。

第一,TSDF的线性插值在极度尖锐的棱角处会产生轻微的圆角效果。对于衣服来说这几乎不是问题,因为布料本来就是柔软的曲面;但如果用来还原机械零件那种硬朗的直角,就可能有些失真。

第二,当前框架只生成几何形状,不生成颜色纹理或材质属性。一件3D服装只有光秃秃的灰色网格,没有花纹、颜色或布料材质,在实际应用中还需要单独的纹理生成步骤。

第三,不同UV分片之间的边界缝合问题。DiffGI把一件衣服分成多个UV图块分别处理,每个图块之间是独立重建的,没有强制约束相邻图块在3D空间里的接缝要完美对齐。这种"缝合不齐"的问题不影响几何评测指标,但在进行物理仿真时(比如模拟衣服在风中飘动),接缝处的不连续会造成破绽。

针对这些问题,研究团队也提出了未来的改进方向:引入能保持尖锐边缘的等值面提取算法(如对偶轮廓化)来处理棱角问题;扩展潜在空间以同时生成高分辨率纹理和材质图;设计两阶段流程,先生成2D版型布局,再从版型重建3D形状,以支持更精细的服装设计控制。

说到底,DiffGI做的事情,是把一个长期困扰数字服装领域的根本性问题——"怎么让AI真正理解薄薄一层布料"——换了一套思路来解决。不是靠堆砌更大的模型、更高的分辨率、更强的算力,而是从"表示方法"这个最基础的层面做改变:用连续的距离数字代替非此即彼的格子标记,用可微分的坡道代替不可逆的阶梯跳跃,让整个从2D信息到3D形状的过程变成一个可以双向传导、可以学习优化的闭合回路。

这项改变的影响,对普通人来说可能是:你在网上看到的虚拟试衣、游戏里的服装系统、影视特效里的布料飘动,都有机会变得更真实、更细腻,而支撑这些效果的计算机,也许只需要一台普通的笔记本就够了。当然,从研究室里的技术突破到大规模商业落地,还有相当长的路要走,但这一步的方向是清晰的。有兴趣深入了解技术细节的读者,可以通过arXiv:2607.13365查阅完整论文。

Q&A

Q1:DiffGI和普通3D建模软件有什么区别?

A:普通3D建模软件需要人手工逐步雕刻形状;DiffGI是一套AI自动生成系统,输入一张照片或轮廓草图,几秒钟内就能自动生成完整的3D服装网格。最大的不同在于DiffGI专门为薄壳结构(比如衣服)设计,能生成开放边界、不封闭的薄面结构,而传统3D生成AI往往只会生成有厚度的"密封体",把衣服做成两层厚壳。

Q2:TSDF(截断有符号距离函数)为什么比黑白占位图更好用于服装建模?

A:黑白占位图对每个格子只有"有"或"没有"两种状态,边界只能落在格子边上,分辨率不够高时边界就像锯齿;TSDF给每个格子存储一个到最近边界的距离数值,边界位置可以在两个格子之间的任意位置精确插值,不受格子分辨率限制。对于服装这类边界密集、弯曲复杂的对象,TSDF能在低得多的分辨率下达到同样或更好的精度,大幅减少计算量。

Q3:DiffGI生成的服装3D模型能直接用于物理仿真或游戏引擎吗?

A:目前有一定限制。DiffGI生成的是标准三角网格,且因为采用多图块UV展开,不同图块之间的边界接缝在3D空间里可能存在微小不连续,会影响物理仿真的准确性。此外当前版本不生成颜色纹理,只有几何形状。研究团队已将跨图块边界一致性约束和纹理生成列为后续工作方向。作为快速原型参考或静态渲染,当前版本已经足够实用。