来源:市场资讯

(来源:科技行者)

打开网易新闻 查看精彩图片

这项由华南理工大学数学学院与电子信息工程学院联合开展的研究,发表于2026年第43届国际机器学习大会(ICML 2026),论文编号为arXiv:2607.17972。感兴趣的读者可通过该编号查询完整论文。

扩散模型是当前最炙手可热的图像生成技术之一,它能从一团随机噪点出发,一步步"雕刻"出清晰逼真的图像。手机里的AI绘图应用、设计师用的创意辅助工具,背后大多跑着这类技术。然而,这套"雕刻"过程并不便宜——它需要反复调用神经网络做出预测,每调用一次就要消耗一份算力。为了让这个过程更快,研究者们一直在想方设法减少调用次数,同时保住图像质量。

这项研究发现了一个此前被忽视的问题:现有方法把每一步的预测结果当成"权威答案",独立使用后就丢弃,完全没有利用历次预测之间蕴含的规律。研究团队由此提出了一种名为"前向过程对齐扩散预测"(DiFA,Forward-Process Aligned Diffusion prediction)的新框架。它不需要重新训练模型,也不更换底层的数学求解器,只是在每一步预测完成后,像一个经验丰富的老师傅那样回头看看之前做过的判断,从中提炼出更可靠的参考依据,再把这份参考依据用来修正当前的预测结果。实验表明,这套方法在CIFAR-10和ImageNet两个标准图像生成基准上,显著改善了包括FID、IS和FD-DINOv2在内的多项质量指标,且全程无需额外的网络调用。

一、扩散模型的"雕刻游戏":为什么它既强大又麻烦

要理解这项研究解决的问题,先得弄清楚扩散模型是怎么工作的。可以把这个过程想成一个从混沌到秩序的雕刻游戏。起点是一块完全随机的"大理石噪点",终点是一幅清晰的图像。雕刻师(也就是神经网络)每次只能打磨一小步,通过反复迭代逐渐让图像成形。

这个游戏的训练阶段和使用阶段是反向进行的。训练时,模型学习的是"如何把一张干净的图像逐渐加噪,变成一团随机噪点",这个方向叫做前向过程。使用时,模型则反过来,从噪点出发,一步步去掉噪声还原图像,这个方向叫做逆向过程。

在逆向雕刻的每一步中,模型会做一件关键的事:根据当前这块"半成品大理石",猜测最终的干净图像应该长什么样。这个猜测结果在论文里被称为"干净信号预测"。随后,求解器(一种数学工具,类似导航仪)会根据这个猜测决定下一步怎么打磨。

问题就出在这里。模型的猜测并非一成不变地准确,尤其是在步数很少的情况下。当只有五步或十步来完成整个雕刻过程时,每一步的偏差都会累积,最终导致图像质量大幅下滑。更关键的是,现有的求解器只是把当前这步的猜测结果拿去用,用完就丢掉,下一步再重新猜测时完全不参考之前的历史。这就好比一个雕刻师每次下刀前都忘记了自己之前刻过什么,只靠当下的一时判断。

二、被浪费的"历史经验":现有方法忽略了什么

研究团队注意到,在整个逆向雕刻过程中,模型每一步都会产生一个关于"最终图像长什么样"的预测。这些预测不是彼此孤立的——它们都在猜测同一张图像,只不过是在不同的"噪声程度"下做出的猜测。

从扩散模型的数学结构来看,这背后有一个深刻的统计规律。前向加噪过程可以被理解为:在不同噪声水平下,对同一张干净图像做带噪声的观测。噪声越小(也就是越靠近逆向过程的末尾),观测越精准;噪声越大(靠近逆向过程的起点),观测越模糊。用信号处理的语言说,这对应着不同的"信噪比"(SNR)。

现有的求解器在数学上已经很精密,它们用高阶数值方法来精确积分轨迹方程,以减少离散化误差。但这些求解器把注意力全放在"如何把当前预测用得更准"上,完全没有去思考"过去几步的预测合在一起能告诉我们什么"。研究团队把这个被遗忘的维度称为"时序冗余"——历次预测之间存在大量重叠信息,这些信息完全可以用来相互验证、相互修正。

与此同时,研究团队还指出了另一个根本性问题:模型的训练目标是最小化均方误差(MSE),这导致模型输出的预测结果在统计上是真实分布的"平均值",而非某一个具体的清晰样本。这种"均值偏差"会让预测结果偏向平滑,丢失细节,就像用很多张照片叠加平均后得到的模糊脸。

三、"经验老师傅"的工作方式:DiFA框架的核心思想

研究团队提出的DiFA框架,可以用一个直观的图像来理解。假设你是一个需要识别一张模糊照片内容的人,你手边有同一张照片在不同光线、不同焦距下拍摄的多个版本。每个版本都有些信息,也有些噪声。聪明的做法不是只看最新的那张,而是把几张放在一起对比,找出它们共同清晰的部分,再以此为基础来理解最模糊的那张。

DiFA的工作原理正是如此。它维护一个"历史预测缓冲区",存储最近几步(默认为3步)的干净信号预测结果。在当前步骤产生新的预测后,DiFA会先从历史记录中构建一个"时序共识",再用这个共识来修正当前的预测,然后把修正后的结果交给下游求解器使用。整个过程不需要额外调用神经网络,新增的计算量仅来自维护缓冲区和做几次轻量级的相似度计算。

这个框架之所以合理,有严格的统计学基础。研究团队引入了一个理想化的独立观测模型:把不同时间步的历史预测看作对同一个"干净信号锚点"的带噪观测,噪声大小与各步骤的信噪比成反比。在这个模型下,最优的线性无偏估计(BLUE)恰好是各步预测按信噪比加权平均的结果——信噪比高的步骤(更靠近逆向过程末尾,噪声更少)权重更大,信噪比低的步骤权重更小。这个加权融合的结果,比任何单独一步的预测都有更小的估计方差,这一点在论文的命题4.2中得到了严格证明。

更漂亮的是,这个加权融合公式可以被转化为一个递归的卡尔曼滤波更新规则。卡尔曼滤波是航空航天和导航领域的经典工具,专门用于从一系列带噪声的观测中估计真实状态。研究团队在定理4.3中证明,在理想独立观测模型下,全历史精度加权估计器与静态状态卡尔曼递归实现完全等价。这个联系不只是数学上的巧合,它揭示出DiFA的本质:把扩散模型的逆向采样重新理解为一个顺序状态估计问题,用经典滤波理论来提升预测质量。

四、从理论到实践:DiFA的具体工作步骤

将上述理论转化为实际可用的算法,研究团队设计了一套轻量级的实例化方案,以下将其完整展开。

历史缓冲区的管理方式是:在逆向过程的每一步,保存当前步骤产生的干净信号预测及其对应的对数信噪比(logSNR)值。保存时只记录"已处理过的历史步骤",当前步骤的预测不加入历史,这样做是为了防止模型用自己当前的输出来强化自己,形成循环自我印证的偏差。窗口大小K默认设为3,即最多保留最近3步的历史记录。

在构建时序共识之前,需要先做一步"对齐"处理。不同时间步的预测可能在整体亮度或对比度上有所差异,直接混合会引入不必要的偏差。解决方案是对每一条历史预测做逐通道的均值-方差归一化,把它的统计特性对齐到当前预测的水平,这个操作类似于把几张不同曝光的照片调整到相同的亮度基准再进行比较。

接下来计算每条历史预测与当前预测的"结构相似度",方法是先对两者做轻量级空间平均池化,再计算余弦相似度。相似度高的历史预测说明它和当前预测描述的是相似的图像结构,应该获得更高的融合权重。与此同时,logSNR距离越近的历史步骤也应获得更高的权重,因为信噪比相近的两步对应的观测条件更接近,信息更兼容。这两个因素被合并为一个"相容性分数",经过softmax归一化后得到最终的融合权重,加权叠加历史预测便得到时序共识。

拿到时序共识之后,DiFA计算当前预测与共识之间的偏差向量。这个偏差向量代表着"当前步骤独有的、历史步骤中尚未充分表达的信息"。直接把这个偏差加回去会引入太多不稳定分量,因此需要先做一步正交投影:去掉偏差向量中平行于当前预测的成分(这部分主要是幅值变化,不携带结构信息),保留垂直于当前预测的成分(这部分携带真正的结构差异信息)。

然后,投影后的偏差被进一步分解为低频平滑分量和高频细节分量。低频分量代表大尺度的结构校正,高频分量代表细节纹理信息。研究团队设计了一个基于当前步骤logSNR的门控函数:当logSNR较大时(接近逆向过程末尾,噪声少,图像接近成型),允许更多高频细节进入修正;当logSNR较小时(接近逆向过程起点,噪声多,结构尚未稳定),抑制高频分量,避免把噪声误当成细节放大。最终的修正量是低频分量与门控后高频分量的组合,乘以一个可调的强度系数ω(默认为0.7),加到当前预测上,得到修正后的预测结果,再传递给下游求解器。

这个偏差引导机制的设计动机是对抗时序共识带来的"过度平滑"副作用。多步预测的加权平均天然会磨平细节,就像多次叠加的照片会变模糊一样。偏差引导相当于在共识的稳定性和当前步骤独有细节之间找到平衡,而logSNR门控则确保这种平衡随信噪比动态调整,而非一刀切。

五、实验验证:数字背后的故事

研究团队在多个标准测试场景中系统评估了DiFA的效果,使用的评估指标涵盖三个维度:FID(衡量生成图像与真实图像分布的差距,越低越好)、IS(综合衡量图像质量和多样性,越高越好)、FD-DINOv2(基于视觉感知模型的质量评估,越低越好)。

在CIFAR-10数据集(32×32的小图像)上,测试了DPM-Solver++和UniPC两种求解器。在仅使用8步的极端场景下,DiFA将DPM-Solver++的FID从8.40降至4.15,降幅超过50%,把原本质量很差的输出变成了可用的高质量图像。在12步这个对实际应用很关键的场景下,FID从3.70降至2.18,超过了同期报告的12步EVODiff方法(FID 2.25)。即便是在20步这个基线求解器通常已经趋于饱和的场景,DiFA仍然带来了改善(FID从2.33降至1.96),成功突破了2.0这个长期被视为门槛的数值。

在ImageNet-64数据集(64×64的图像)上,DiFA在DPM-Solver++、UniPC、Heun三种求解器上都表现出一致的改善。特别值得关注的是Heun求解器在5步场景下的表现:基线FID高达230.05(基本就是在生成噪点),加入DiFA后降至110.20,说明预测对齐机制能有效缓解极少步数下的轨迹漂移问题。在25步场景下,DiFA配合DPM-Solver++和UniPC分别达到了1.64和1.63的FID,在不重新训练模型的情况下,达到了接近需要大量算力训练的蒸馏方法的水平。

FD-DINOv2指标的改善同样值得关注。这个指标基于一个强大的视觉感知模型,对图像的感知质量更敏感,更接近人眼判断。DiFA在这个指标上也取得了一致的提升,说明改善不只是统计分布层面的,而是真实的感知质量提升。研究团队特别指出,普通的平均融合方法往往会通过牺牲清晰度来改善FID,而DiFA通过结构过滤和纹理增强的双重机制,同时改善了统计保真度和感知锐度,两者并不矛盾。

在消融实验方面,研究团队系统拆解了各组件的贡献。在EDM设置下的10步测试中,移除历史共识(窗口大小退化为1)会使结果完全退回基线(FID 5.071);加入历史共识但不使用SNR门控,FID降至3.375;进一步加入幅值对齐,FID降至2.846;完整的DiFA实现达到了2.797。这个拆解实验清晰地说明,历史共识是改善的主要来源,SNR门控和幅值对齐分别提供了额外的稳定性。

关于超参数的敏感性,实验表明DiFA在不同参数设置下都稳定有效。历史窗口大小K表现出U形特征:太小(K=1)退化为基线,太大(K=4)会引入过时预测导致性能下降,K=3是最优点。偏差增强系数γ0在1.3到1.5范围内都能取得较好效果,极端值才会引起性能波动。logSNR兼容系数μ在0.1到0.3范围内都保持稳健。

六、能力边界与跨场景验证:DiFA不只是扩散模型的专属工具

研究团队还验证了DiFA在扩散模型以外的应用潜力。流匹配(Flow Matching)是另一类流行的生成模型框架,其数学结构与扩散模型不同,但同样具有迭代生成过程。研究团队对DiFA做了针对性适配,将其应用于SiT-XL/2这一基于流匹配的大型图像生成模型,在ImageNet 256×256的高分辨率场景下进行了系统测试。

初步实验在无分类器引导(CFG)设置下进行,用于验证基本的可迁移性。在5步场景下,FID从94.53降至72.40,IS从22.50升至31.83;在10步场景下,FID从27.81降至21.60;在50步场景下也有小幅改善。这些结果表明,DiFA利用的时序冗余在流匹配轨迹中同样存在。

更系统的验证在启用分类器引导(CFG=1.5)的场景下进行,覆盖了Euler和Heun2两种求解器,以及5步、10步、20步三种NFE配置,以及多个不同的偏差增强系数取值。结果表明,DiFA在几乎所有配置下都改善了FID、IS、sFID和精确率指标。在5步这个最困难的场景下,Euler求解器的FID从52.64降至27.61(降幅47.5%),Heun2的FID从14.64降至7.99(降幅45.4%)。在20步场景下,基线已经较强,改善幅度自然有所收窄,但仍然普遍为正。精确率(Precision)在几乎所有配置下都有提升,召回率(Recall)基本持平,只在Heun2的20步场景下观察到小幅下降,说明在高NFE引导采样下存在轻微的精确率-召回率权衡。

在LSUN Bedroom潜在扩散模型上的实验进一步验证了DiFA不受像素空间扩散的限制,能够作用于潜在空间的采样循环,在5步、10步、20步场景下均取得了改善,5步场景的FID改善幅度达到72.2%。

七、与相关方法的对比:DiFA站在哪里

这项研究与同类工作相比,最显著的区别在于它完全不需要额外的训练或蒸馏,也不依赖外部模型或人工设计的引导信号。

蒸馏类方法(如一致性模型、渐进蒸馏、单步对抗蒸馏)通过大量重新训练来把多步生成压缩为少步甚至一步,代价是需要大量算力,且训练后的模型往往只适用于特定场景,丢失了原始模型的零样本泛化能力。DiFA完全不需要这些代价。

高阶ODE求解器类方法(如DPM-Solver系列、UniPC)专注于减少数值积分的离散化误差,把历史网络输出用作更高阶的数值估计,但它们假设每步预测都是准确的,完全不处理预测本身的估计不确定性。DiFA与这类方法互为补充,能直接套用在这些求解器之上提供额外增益。

EDM2提出了用"差版本模型"来引导原模型的自引导机制,思路上与DiFA有一定相似之处,但它需要额外维护一个退化版本的辅助模型,成本更高,且依赖于精心设计的引导信号。DiFA不需要任何辅助模型,所有信息都来自原模型在当前采样轨迹上产生的历史输出。

Zigzag等显式路径纠错方法通过在采样轨迹上插入回退和前进的"锯齿"操作来纠正中间误差,但这类方法通常需要额外的网络评估,在低NFE预算下成本较高。DiFA的新增计算仅为O(Kd)的轻量级操作,与网络评估的成本完全不在一个量级。

八、局限性与未来方向:坦诚的边界说明

研究团队在论文中明确指出了几个局限性,这些限制为未来研究指出了方向。

当前的DiFA框架依赖于干净信号参数化的预测形式,即模型直接(或可以转化为)输出对干净数据的估计。对于纯速度场参数化的流匹配模型,需要额外的坐标变换步骤才能应用DiFA,这一步骤引入了额外的近似。

历史窗口大小、偏差增强系数等超参数目前是固定的,不随生成过程动态调整。在实践中,不同的时间步、不同的数据分布、不同的求解器可能需要不同的最优超参数设置,自适应策略可以进一步挖掘DiFA的潜力。

当前的统计分析基于理想化的独立观测假设,但实际上相邻时间步的预测之间存在显著的时序相关性——后一步的输入状态是由前一步的输出决定的。这种相关性会使实际的方差缩减幅度与理想模型的理论预测有所偏差。研究团队指出,构建针对时序相关误差的严格理论框架是未来工作的重要方向。

此外,研究团队展望了将DiFA应用于文本到图像生成、视频生成、逆问题求解(如图像修复、超分辨率)和蒸馏流程中的可能性,这些场景中迭代预测的时序冗余同样存在,有望从类似的对齐机制中获益。

说到底,DiFA做的事情用一句话概括就是:让模型在每一步预测时,能参考自己之前做过的判断,而不是每次都从零开始、忘记历史。这个想法直觉上简单,但背后有严格的统计学支撑,而且在多个场景下被实验验证是有效的。

对于普通用户而言,这项研究意味着用同样的模型、同样的步数,可以生成质量更好的图像;或者用更少的步数,达到之前需要更多步数才能达到的质量。这直接降低了使用AI图像生成的算力门槛和等待时间。当然,一个有趣的思考是:既然历史预测蕴含着如此丰富的信息,是否在其他序列决策场景——比如视频生成、音频合成,甚至机器人控制——中,类似的"历史共识"机制也能发挥作用?这或许是一个值得更多研究者探索的方向。有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.17972查阅完整论文。

Q&A

Q1:DiFA方法需要重新训练扩散模型吗?

A:不需要。DiFA是一个完全无需训练的推理时框架,它直接作用于现有预训练扩散模型的采样过程,不修改模型权重,也不需要额外的训练数据或算力。只需在采样循环中加入DiFA的历史缓冲和偏差引导逻辑即可使用。

Q2:DiFA用了历史预测做融合,会不会让生成速度变慢很多?

A:基本不会。DiFA不增加神经网络调用次数,所有额外计算仅包括维护一个小型历史缓冲区、计算轻量级相似度权重和做简单的向量运算。对于固定窗口大小K,每步新增计算量为O(Kd),与神经网络推理的计算成本相比完全可以忽略不计。

Q3:DiFA只适用于图像生成领域吗?

A:当前研究主要验证了DiFA在图像生成(CIFAR-10、ImageNet)和流匹配模型(SiT-XL/2)上的效果。但研究团队指出,DiFA的核心原理——利用迭代预测的时序冗余构建历史共识——在视频生成、音频合成、逆问题求解等存在迭代预测过程的场景中同样可能适用,这些方向被列为未来工作。