打开网易新闻 查看精彩图片

这篇综述由麦吉尔大学、蒙特利尔学习算法研究所(Mila)、剑桥大学、多伦多大学、穆罕默德·本·扎耶德人工智能大学等多所机构联合完成,于2026年7月以arXiv预印本形式发布,编号为arXiv:2607.13431v1。有兴趣深入了解的读者可通过该编号查询完整论文。

当你使用ChatGPT或其他AI助手生成一段文字时,你可能从未想过,这段文字是如何被"造出来"的。在绝大多数人的认知里,AI写字就像人打字一样——一个字一个字地往后拼,前一个字决定后一个字,环环相扣,不可回头。这种方式叫做"自回归生成",是目前几乎所有主流大语言模型的核心机制。

然而,这篇综述想要告诉你的是:还有另一条路,一条更像"拼图"而不是"打字"的路。这条路的名字叫做**离散扩散模型**(Discrete Diffusion Models,简称DDMs)。研究团队花费大量篇幅,系统梳理了这一领域从理论基础到实际应用的全貌,并提出了一套统一的分析框架——其核心主张是:**"分词方式"本身就是模型设计的第一块基石,而非可以随意忽视的预处理细节。**

一、为什么"一个字一个字往后写"会出问题

要理解离散扩散模型的价值,得先明白它想解决什么麻烦。

现有的主流AI写作方式,本质上是一种"单行道"。模型从左到右,依次生成每一个词,生成完就算数,无法回头修改。这就好比你用一支钢笔在纸上写字,墨水一落,白纸变黑,永不可撤销。这种方式在某些场景里工作得很好,比如连续对话、流式输出。但一旦遇到需要"全局谋划"的任务,麻烦就来了。

举个例子。如果你让AI帮你完成一段代码,代码的第一行必须和最后一行相互呼应,而自回归模型在写第一行时,根本还不知道最后一行会是什么。它只能"蒙着眼睛往前走",一旦走偏,后面的所有内容都会跟着偏。又比如,你让AI帮你填写一段中间缺失的文字(这种任务叫"填空"或"infilling"),自回归模型天然不擅长,因为它的"视野"只朝一个方向开放,看不见右边已有的内容。

此外,自回归模型的生成速度也受到根本性限制。无论你的电脑有多少个处理器并排工作,生成第100个词之前必须先完成第99个词——这是一种无法绕过的串行依赖,序列越长,等待越久。

离散扩散模型的核心思路恰好相反。它不从左到右一步步"打字",而是先把整个输出全部遮住(想象一张全是马赛克的图片),然后通过反复"去噪"的方式,逐渐让清晰的内容浮现出来。每一次去噪,模型都能同时看到整个序列的当前状态,从而做出更具全局意识的判断。这种方式天然支持"回头修改"——某个位置的词语如果生成得不好,可以在下一轮去噪时重新考虑。

二、"拼图游戏"的物理学起源

离散扩散模型的灵感来自物理学中的一个经典现象:扩散。你往一杯清水里滴一滴墨水,墨水会慢慢扩散,最终均匀分布在整杯水中。这个过程是不可逆的——你无法让均匀的墨水自动重新聚集到最初的那一滴。

扩散模型的核心技巧,正是让神经网络学会"逆转这个过程"。在图像生成领域,这已经大获成功:先把一张清晰的图片慢慢加噪声,直到变成随机的白噪声;再训练一个网络,学会从白噪声一步步"还原"出清晰图片。这就是现在广泛使用的Stable Diffusion等图像生成工具的底层逻辑。

但文字不是图片。图片里的像素是连续的数值,可以自然地被高斯噪声"污染"。文字是离散的符号——"猫"这个词要么是"猫",要么是"狗",中间没有"0.7个猫加0.3个狗"这种东西。直接把图像扩散的方法搬到文字上,会产生严重的"语义错位":模型在连续空间里学会的去噪技巧,回到离散文字空间时会出现大量"四不像"的结果。

因此,离散扩散模型的研究者们放弃了"先把词语嵌入连续空间再扩散"的投机路线,转而在离散空间里直接定义噪声过程。这意味着,"污染"一个词语的方式不是加高斯噪声,而是把它替换成另一个词、或者替换成一个特殊的"遮蔽符号"([MASK])。相应地,"去噪"的任务变成了:根据上下文,猜出被遮住或被替换的那个词原本是什么。

三、三种"弄脏文字"的方式及其深远影响

这篇综述花了相当大的篇幅,讨论如何在离散空间里定义"噪声"——因为这个选择几乎决定了后续一切。

最直接的方式叫**均匀替换**:每个词以一定概率被随机替换成词表中的任意其他词。这就好比把一篇文章里的某些词随机替换成字典里随便一个词,结果可能是"今天天气很好的"变成"今天香蕉很好的"。这种方式在数学上很干净,但实际使用时效果不理想——因为模型必须在几万个候选词中猜对一个,难度太高。

第二种方式叫**吸收态遮蔽**(Absorbing/Masking):每个词以一定概率被替换成统一的[MASK]符号,一旦被遮住,就再也不会自动恢复。这就像把文章里某些词涂成黑块,模型的任务是根据未被遮住的内容推断黑块下面应该是什么。这种方式和BERT等预训练模型的训练方式几乎一致,因此工程上非常成熟,训练也最稳定。事实上,目前几乎所有大规模离散扩散语言模型都采用了这种方式,包括MDLM、LLaDA等影响力较大的系统。

第三种方式叫**结构化转移**:替换的目标词不是随机选取的,而是根据某种"相似度"来决定——比如,和原始词在语义上接近的词更可能成为替换目标。对于蛋白质序列,这种相似度来自生物进化数据;对于音频编码,这种相似度来自编码本的几何结构。这是最具信息量、也最难设计的方式,目前在实践中应用较少,但研究者认为这是一个被严重低估的方向。

这三种方式的选择,不只是技术细节。它根本性地决定了:模型在训练时面对什么难度的问题、生成时按照什么顺序"揭晓答案"、以及最终输出的质量和多样性。研究团队将这个选择称为"转移矩阵设计",并指出它是整个离散扩散框架中最重要的设计轴之一。

四、"分词"凭什么是第一块基石

这篇综述最核心的主张,也是最容易被忽视的洞见,就是:**分词方式本身不是预处理细节,而是模型设计的第一个决策,它的影响贯穿后续所有环节。**

以文字处理为例。现在主流的大语言模型通常使用BPE(字节对编码)或WordPiece等算法,把文字切成子词单元。"tokenization"这个英文词可能被切成["token", "ization"]两个子词。这种切法能压缩序列长度,但带来一个微妙问题:这些子词在语义上完全没有相互关系,"token"和"##ization"在词表里的编号可能相差几千,但这个编号差没有任何意义。

当离散扩散模型试图用"均匀替换"来污染文字时,它会把"token"随机替换成词表里任意一个子词。问题在于,词表里可能有几万个子词,绝大多数替换都毫无语义联系。这导致噪声太"猛烈",模型需要从极度混乱的状态中恢复信息,训练难度极高。这正是吸收态遮蔽之所以流行的原因——[MASK]这个符号虽然也是"无信息"的,但它至少明确标记了"这里有内容被隐藏了",这比随机替换提供了更多的结构信息。

在图像和音频领域,分词问题更加复杂。连续的像素值或音频波形需要先经过一套"向量量化"(VQ-VAE、VQ-GAN等)系统,转换成离散的编码本索引。这套系统本身就是一个神经网络,它的编码本(codebook)决定了每个离散符号所代表的视觉或声学内容。关键的是,这个编码本是有几何结构的——编码本里编号相近的两个符号,其对应的图像块往往在视觉上也相似。然而,几乎所有现有的离散扩散模型在处理图像token时,都把它们当作"没有结构的离散符号",完全忽视了这种几何相似性。研究团队指出,这是一个被浪费的机会:如果噪声过程能利用编码本的几何结构(让视觉上相似的符号更容易相互转换),理论上能得到更平滑的噪声轨迹和更高质量的生成结果。

在科学领域,分词天然就是有结构的。蛋白质是由20种氨基酸组成的序列,DNA和RNA由4种核苷酸组成。这些"字母"有着来自进化生物学的相似度矩阵(比如BLOSUM矩阵)——某些氨基酸在进化过程中更容易相互替代,这种替代概率就是一种天然的"噪声结构"。分子图里的原子类型和化学键类型也有化学意义上的相似性。研究团队建议,这些领域的离散扩散模型应该把领域知识直接融入噪声过程的设计,而不是继续沿用文字处理里的通用吸收态遮蔽。

五、统一框架的四个零件

综述的一大贡献是提出了一套统一的分析语言,把各种离散扩散模型都拆解成四个零件的组合:**噪声算子、去噪网络、训练目标和采样器**。

噪声算子就是前面讨论的"如何弄脏输入",可以是吸收态遮蔽、均匀替换、结构化替换,或者它们的混合。去噪网络是一个神经网络,它接收被噪声污染的序列,输出对原始内容的猜测。大多数现代模型选择让网络直接预测原始的干净词语是什么,这种做法叫做"x?参数化"——相当于直接让网络"猜谜底",而不是猜中间状态。

训练目标决定了网络用什么损失函数来学习。最严谨的方式是最大化变分下界(ELBO),这在数学上等价于最小化模型生成分布和真实数据分布之间的差距。研究表明,对于吸收态遮蔽扩散,这个复杂的变分目标在数学上等价于一个简单的"加权遮蔽语言模型损失"——也就是说,训练离散扩散模型在数学上和训练BERT几乎是一回事,只是对不同噪声程度下的预测误差加了不同的权重。这个发现极大简化了训练流程,使得扩散语言模型可以直接复用成熟的BERT式训练基础设施。

采样器是推理阶段的决策系统,决定如何从完全遮蔽的序列出发,一步步"揭示"最终输出。最简单的方式是按照学到的反向转移概率逐步采样,但实践中有更多精细的策略:按照置信度排序,先揭示模型最确定的位置(置信度高的位置先"定稿");或者允许已经揭示的位置重新被遮蔽,重新猜测(相当于"悔棋")。这些策略的选择会显著影响生成质量和速度,且完全不需要重新训练模型——这是离散扩散相比自回归模型的一个独特优势。

六、从文字到蛋白质:一个框架走遍所有离散数据

这篇综述的另一个雄心是证明:这套框架能够跨越领域边界,统一地解释和指导文字、代码、图像、音频、视频、蛋白质、DNA、分子图等完全不同类型的离散数据生成任务。

在文字和代码领域,当前最先进的离散扩散语言模型(如LLaDA、Dream 7B等)已经在指令跟随、数学推理、代码填充等任务上展现出与自回归模型相当的竞争力。这些模型的一个显著优势是对"填空"任务的天然适应性——因为生成过程本就是双向的,模型可以同时利用左侧的前文和右侧的后文来填补缺失部分,而自回归模型做同样的事情需要额外的工程技巧。代码生成尤其适合扩散模型,因为代码的全局约束极强(函数的开头和结尾必须匹配,括号必须配对),离散扩散的全局视野在这里有天然优势。

在图像、音频和视频领域,离散扩散模型通常作为"第二阶段"出现:先用向量量化编码器把连续信号转换成离散token序列,再用离散扩散模型在token空间里进行生成。这种方式的核心优势是"可编辑性"——只需要重新遮蔽图像中某个区域的token,就能在不改动其他部分的情况下修改那个区域,类似Photoshop的局部涂改功能,但无需重新训练任何模型。

在蛋白质和DNA/RNA领域,离散扩散模型正在成为一种核心工具。蛋白质本质上就是一串由20种氨基酸组成的离散序列,DNA就是由4个字母组成的长字符串。这些天然的离散性使得序列直接在"字母表"上进行扩散,无需任何量化步骤。更重要的是,这些领域有丰富的领域知识可以融入噪声过程设计:进化替代矩阵能告诉我们哪些氨基酸在进化中容易相互替换,化学价键规则能约束分子图的噪声过程只产生合法的化学结构。目前已经有多个工作将离散扩散用于抗体设计、蛋白质逆折叠(从三维结构反推氨基酸序列)、DNA调控元件设计等任务,并取得了令人鼓舞的结果。

在分子图生成领域,挑战在于图本身是一个复杂的组合结构:原子是节点,化学键是边,两者都有离散的类型,而且必须满足严格的化学价键约束。DiGress等模型把离散扩散直接应用于原子类型和化学键类型的联合噪声-去噪过程,取得了在分子生成标准基准上的竞争性结果。但化学有效性问题至今仍是主要瓶颈——一个随机去噪的分子很可能在化学上是"非法"的(比如某个碳原子接了五根键),需要在采样阶段施加额外的约束。

七、推理时的"下棋"策略

离散扩散模型的推理阶段,是整篇综述中技术细节最丰富的部分之一。简单来说,推理就是从一个全部被遮蔽的序列出发,经过若干步去噪,最终得到一个完整的输出。但"若干步"怎么走,大有学问。

最简单的策略是按照固定的步骤数均匀地降低噪声程度,每一步让模型预测所有被遮蔽位置的内容,然后按照某种规则决定哪些位置"定稿"、哪些继续保持遮蔽状态。"按置信度优先揭示"是目前最常用的策略:模型在每一步预测所有遮蔽位置,对每个位置的预测都有一个置信度分数(通常是预测概率的最大值),然后优先"定稿"置信度最高的若干个位置,其余位置继续保持遮蔽。这就像在做多项选择卷子时,先把最有把握的题做完,再用剩下时间攻克难题。

更精细的策略允许"悔棋":已经定稿的位置,如果后续发现它与上下文不协调,可以重新标记为遮蔽状态,重新接受模型的审视。这种机制在自回归模型中根本不存在(已经输出的token是不可撤回的),是离散扩散模型独有的能力。研究表明,适度的"悔棋"能显著提升生成质量,尤其在需要全局一致性的任务(如数学推理、代码生成)中效果更突出。

另一个重要方向是"分块扩散"(Block Diffusion):把输出序列切成若干块,在块内部进行双向扩散,块与块之间保持自左向右的因果顺序。这种方式在自回归模型和全局扩散之间取了一个折中点,兼顾了流式输出(用户不需要等整个序列生成完才能看到结果)和全局一致性(每个块内部的生成是双向感知的)。这被认为是离散扩散走向实际部署的重要过渡方案。

推理加速也是一个活跃的研究方向。由于每次去噪都需要对整个序列做一次双向注意力(计算量是序列长度的平方),推理速度是离散扩散模型面临的主要工程挑战之一。当前的加速方案包括:知识蒸馏(把多步去噪压缩成少步甚至一步)、KV缓存复用(针对已经稳定不变的token跳过重复计算)、推测解码(先用小模型快速草稿,再用大模型验证),以及选择性更新(只对还在变化的位置重新计算,跳过已经稳定的位置)。

八、训练大型离散扩散模型的实践智慧

综述还系统整理了在大规模训练离散扩散语言模型时积累的实践经验,这些经验对于打算进入这个领域的研究者尤为珍贵。

噪声调度(noise schedule)的设计类似于课程设置:它决定了在训练过程中,模型面对的题目难度如何随时间变化。对于吸收态遮蔽扩散,噪声调度就是"每个时间步遮蔽多少比例的token"。研究发现,余弦调度(cosine schedule)在数学上对于吸收态遮蔽扩散是最优的,这为一个原本只靠经验调参的超参数提供了理论依据。不同的噪声调度会显著影响训练的稳定性和最终模型的生成质量。

从预训练的自回归模型出发,通过持续训练把它转换成扩散模型,是一种节省计算资源的常见策略。DiffuLLaMA等工作展示了如何从LLaMA等开源自回归模型出发,通过相对少量的训练步数转化为离散扩散模型。这种转化通常需要一些特殊处理,比如把模型的注意力机制从单向改成双向、调整位置编码等。

对齐和强化学习同样可以应用于离散扩散模型,但方式与自回归模型有所不同。在自回归模型中,强化学习可以按照token逐步给出奖励;在扩散模型中,一次去噪产生的是整个序列的修改,信用分配(credit assignment)的难度更高。当前的研究提出了多种变体,包括基于DPO(直接偏好优化)的方法、基于策略梯度的方法,以及针对去噪轨迹整体进行优化的方法,各有优劣权衡。

九、如何评价一个离散扩散模型的好坏

评估离散扩散模型并不像评估自回归模型那样直接,这也是综述着重讨论的话题之一。

对于文字生成,传统的BLEU、ROUGE等基于字符串匹配的指标对扩散模型不公平——因为扩散模型生成的文字往往比自回归模型更多样化,与参考答案的字面重合度更低,但并不代表质量更差。更合理的评估方式是在闭合答案的标准测试集上评价(比如数学推理、代码执行通过率),或者采用大型语言模型作为评委进行主观评分。研究团队还特别指出,现有的AI生成文字检测工具对扩散模型几乎失效,因为这些工具假设了自回归的生成顺序,而扩散模型的生成顺序是无序的,需要专门设计适配扩散模型的水印和检测方法。

对于似然值(likelihood)的比较,需要格外小心。自回归模型的困惑度(perplexity)是精确的对数似然值;大多数扩散模型报告的是变分下界,是真实似然值的近似,而且近似的紧度取决于步骤数和参数化方式。直接比较两者会产生误导。研究团队建议,在比较自回归模型和扩散模型的似然时,必须明确说明报告的是哪种值、使用了多少推理步骤、以及分词方案是否一致。

速度和效率的评估同样需要标准化。由于扩散模型的生成质量随推理步数增加而提升,单一的"用N步生成的速度"数字意义有限;更有价值的是"质量-速度帕累托曲线",展示在不同速度预算下能达到的最高质量。研究团队建议所有论文都报告这样的曲线,而不是单点比较,以便公平对比不同系统。

十、已知的局限与开放问题

这篇综述难得地在充分肯定离散扩散潜力的同时,也直接点出了尚未解决的问题,没有回避现实的挑战。

上下文学习能力(in-context learning,即通过几个示例就能理解新任务的能力)目前在离散扩散模型中普遍弱于相同规模的自回归模型。研究者认为,这可能与训练目标(遮蔽预测 vs. 下一词预测)的内在差异有关,也可能是规模和训练数据不足的体现,确切原因仍有争议。

KV缓存类比物的缺失是工程上的重大挑战。自回归模型通过KV缓存,使得生成第N个token时不需要重新处理前N-1个token,从而实现了高效的逐token流式输出。离散扩散模型每步去噪都需要重新处理整个序列,理论上没有类似的直接等价物。当前的研究正在探索各种近似方案(比如对已经稳定的token跳过计算、延迟更新KV状态),但距离自回归模型的效率仍有差距。

流式输出问题也困扰着实际部署。自回归模型可以边生成边输出,用户能立刻看到第一个词。扩散模型原则上需要等所有去噪步骤完成,才能输出一个相对稳定的序列——这对交互式应用体验是个明显缺陷。分块扩散是缓解这个问题的方向,但目前还没有完美的解决方案。

在理论层面,扩散模型的收敛性保证、表达能力的边界、不同参数化方式的等价性,都还有大量未解问题。研究团队认为,这些理论问题不只是学术兴趣,解答它们能直接告诉我们如何选择噪声调度、如何设计转移矩阵,以及何时应该优先选择扩散而非自回归。

归根结底,这篇综述描述的是一个正在快速成熟但尚未定型的研究方向。离散扩散模型已经证明了自己能够做到很多自回归模型不擅长的事情,但在通用语言理解、低延迟部署、上下文学习等关键能力上,还有明显的追赶空间。研究团队预测,未来的主流系统很可能是自回归和扩散的混合体——用自回归处理流式交互,用扩散处理需要全局谋划和反复修改的任务。这不是一场你死我活的竞争,而是两种生成哲学在各自擅长的舞台上共存和互补。如果你对这个方向感兴趣,建议通过arXiv编号2607.13431查阅完整论文,那里有比这篇解读更丰富的数学推导和实验细节。

Q&A

Q1:离散扩散模型和普通大语言模型(如GPT)在生成文字时有什么根本区别?

A:普通大语言模型(自回归模型)像打字一样从左到右一字一字生成,已经输出的内容不能撤回。离散扩散模型则是先把整个输出全部遮蔽,再通过多轮"去噪"逐渐揭示内容,每一轮都能看到整个序列,因此能做全局修改和"悔棋",天然适合填空、代码补全等需要双向上下文的任务。

Q2:离散扩散模型生成速度慢吗?

A:相比自回归模型,离散扩散模型每一步去噪都要处理整个序列,计算量更大;但它能并行生成多个位置,不必串行逐词输出。实际速度取决于使用的步骤数和加速技巧,Mercury等商用系统声称在特定场景下速度超过优化后的自回归基线,但这一说法基于特定硬件和批量设置,不能直接一般化。

Q3:蛋白质序列设计为什么特别适合用离散扩散模型?

A:蛋白质本身就是由20种氨基酸组成的离散序列,天然符合离散扩散的建模假设,无需任何量化步骤。更重要的是,生物进化数据提供了氨基酸之间的替代概率矩阵(如BLOSUM),可以直接用作结构化噪声,让模型学到更生物学合理的序列变异规律,比随机遮蔽更有信息量。