编辑|冷猫

还记得「苦涩的教训」(The Bitter Lesson)吗?

在人工智能的发展史上,长期取得决定性胜利的,往往不是人类精心编写了大量专业知识的系统,而是那些能够随着算力、数据和搜索规模不断扩展的通用学习方法。

苦涩的教训提醒我们:不要把人类解决问题的方式,认为是智能系统唯一正确的计算方式。

语言模型并不必须是自回归的。扩散式语言模型早就成为了一个研究热点。通过并行去噪、全局修订和迭代生成,提供了另一种可能。

而扩散语言模型的全新里程碑已经出现!蚂蚁团队正式发布并且开源 LLaDA2.2,全球⾸个⼤规模 Agentic 扩散模型,让扩散语言模型的技术路线再进一步,正式迈入智能体时代。

打开网易新闻 查看精彩图片

为什么在此之前,扩散语言模型不能成为主流路线呢?

我们曾经报道过一篇研究工作:《The Bitter Lesson of Diffusion Language Models for Agentic Workflows》。

研究团队系统评测了 LLaDA、Dream 等一批扩散语言模型,结论并不乐观:在具身规划任务中,dLLM 会反复尝试同一个失败动作,无法根据时序反馈切换分支;在工具调用任务中,它们在并行去噪的扰动下难以维持严格的 JSON schema。效率上的想象空间与可靠性上的实测表现,出现了明显落差。

ICML 2026 上的最佳论文《The Flexibility Trap》中指出,扩散模型最被称颂的那项优势,也就是任意顺序生成所带来的更大解空间,在数学和代码这类推理任务上反而构成了陷阱。

模型倾向于利用顺序自由度绕开高不确定性的 token,优先填充容易的位置,等到处理关键决策点时,周围上下文已经把答案限定,解空间过早坍缩。

这两篇工作指向扩散语言模型的同一类问题,也无情地揭示了其过去无法胜任现实任务的事实。

扩散语言模型凭块并行解码拿到了自回归模型难以企及的速度上限,LLaDA2.0 把这条路线推到 100B 参数,LLaDA2.1 又靠 token 编辑机制在 HumanEval+ 上跑出 892 TPS,但这些都是在静态生成中展现的数据。

可一旦进入 Agent 那种需要追踪长交互历史、调用外部工具、处理环境反馈并修正自身行为的连续闭环,整套范式的稳定性就开始摇摇欲坠。

症结在于「一次性生成」。传统扩散模型的编辑能力被限制在等长替换上:一个 token 只能换成另一个 token,无法删除一段冗余,也无法在指定位置插入新内容。序列长度固定,结构刚性。早期 block 中的微小偏差,会作为硬约束进入后续 block 的条件上下文,一路固化下去。

这正是 LLaDA2.2 切入的突破口。

打开网易新闻 查看精彩图片

LLaDA2.2 训练与推理框架概览

蚂蚁已发布 LLaDA2.2 的技术报告,感兴趣的读者可以查看。

打开网易新闻 查看精彩图片

  • 模型地址:https://huggingface.co/inclusionAI/LLaDA2.2-flash
  • 代码仓库:https://github.com/inclusionAI/LLaDA2.X
  • 技术报告:https://github.com/inclusionAI/LLaDA2.X/blob/main/LLaDA2_2_tech_report.pdf

四种原子操作写入去噪过程

首先让我们来看 LLaDA2.2 最大的亮点。

在前一代工作 LLaDA2.1 中,已经采用了称为 Token-to-Token(T2T)的编辑机制。那时候的 T2T 编辑只支持两种动作:保留(keep)和替换(substitute)。位置对位置,长度不变。

这套机制能修正局部的错误 token,却无法处理结构性缺陷。n-gram 重复需要删除冗余片段,工具调用缺失参数需要插入新内容,代码补丁不完整需要扩展长度,T2T 对这三类问题均无能为力。

Levenshtein 距离是计算机科学中的经典度量,1965 年由苏联数学家 Vladimir Levenshtein 提出,用来衡量两个字符串之间的差异:把一个序列变成另一个序列,最少需要多少次单字符操作。允许的操作有四种:替换、删除、插入与保留,构成一组完备的编辑原语。任意两个序列之间的转换,都可以分解为这四种操作的组合。

关键在于,这组原语里有两种操作会改变序列长度。删除让序列变短,插入让序列变长。而这正是此前扩散语言模型缺失的能力。

LLaDA2.2 把动作空间扩展到四个原子操作:KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。后两者以编辑控制 token 的形式存在。在位置 i 上,DELETE 移除当前 token 并将后续 token 左移,INSERT 则把 x_i 扩展为([MASK], x_i),为后续去噪轮次创造一个可填充的新位置。序列长度与 token 位置,由此首次成为并行解码过程中可以动态改写的对象。

打开网易新闻 查看精彩图片

难点在于监督信号的来源。模型生成的中间草稿与 ground truth 之间,需要一份逐位置的编辑标签。LLaDA2.2 的做法是计算两者的最长公共子序列(LCS),以匹配位置作为锚点推导标签:匹配锚点标为 keep;锚点之前的空隙内,对齐位置标为 substitute,草稿多余的位置标为 delete,目标序列多余的位置则为后一个锚点分配一个 insert 标签。最后一个锚点之后的所有草稿位置全部标为 delete;若整个块内不存在锚点,则所有位置均标为 delete。

这一改动带来的增益有多大?从消融实验来看:同一个 LLaDA2.2 基座,同一批 SWE 轨迹数据,唯一变量是是否启用 Levenshtein 编辑。SWE-bench Verified 上,35.8 对 44.4,绝对提升 8.6 个百分点。对于仓库级软件工程这类高度依赖结构完整性的任务,允许插入与删除所带来的收益相当可观。

打开网易新闻 查看精彩图片

这也是业界首次将 Levenshtein 编辑大规模集成进扩散模型的去噪过程。扩散模型由此从静态生成器,转变为具备生成中途自我修正能力的动态系统。这标志着扩散模型第⼀次真正拥有了参与⻓程任务的能⼒。

L-EBPO:让环境反馈驱动编辑决策

具备编辑能力之后,下一个问题是何时编辑、编辑何处。

这属于决策层面的问题,超出了语法判断的范畴,且只有在真实环境中才存在正确答案:工具调用是否报错、格式校验是否通过、任务是否停滞,这些才是判断依据。

dLLM 做 RL 的根本困难在于似然计算:一次生成轨迹包含多轮块级去噪,模型并非按 token 顺序逐个决策,精确的序列级似然难以高效求解,而策略梯度方法恰恰需要新旧策略的概率比。

LLaDA2.2 的方案名字很长:基于 Levenshtein 编辑证据下界的分块策略优化方法,简称 L-EBPO。顾名思义,把多轮交互中的编辑决策建模为强化学习问题。

L-EBPO 的结构是一个两层控制体系。外层由 EBPO 治理,优化跨越 Agent 交互轮次的轨迹级决策,管的是整条交互链路上的策略取向;内层管理块内的拼接编辑,即在单次生成步中何时、何处施加 DELETE 与 INSERT。

两层的时间尺度差异很大,一个以轮次为单位,一个以去噪步为单位。L-EBPO 的做法是通过一个扩展动作空间将两层统一到同一个目标函数下:

打开网易新闻 查看精彩图片

token 预测与编辑决策因此被纳入同一目标函数优化。

注意力掩码上还有一处专门处理。多轮 Agent 轨迹与单轮响应不同,若一个扩散块内包含多轮模型输出与工具返回,除首轮之外的所有轮次都必须被掩蔽,否则块内全注意力将造成信息泄漏。

奖励信号完全来自环境反馈,由工具调用执行正确性、输出格式合法性、任务整体完成度三项相加构成。三项分别对应 Agent 失败的三类典型模式,工具调不通、格式不合规、任务没做完。

奖励设计的直接后果是,模型的编辑策略被环境校准:什么样的删除和插入能提高工具调用成功率,什么样的修改能让格式通过校验,这些都由执行结果给出反馈,不依赖预设规则。

传统纠错方法只能在错误表面做覆盖式修正,无法触及需要改变序列拓扑的结构性缺陷。L-EBPO 提供的是另一种路径:一套由环境反馈驱动、能够执行实际删除与补全的自我修正策略,从轨迹层面阻断错误在长程交互中的传播链条。真正解决了《The Flexibility Trap》提出的结构性问题。

128K 原生上下文,与一个固定容量的专家池

Agent 任务对上下文长度有天然要求,上下文是智能体执行任务的「弹药库」,而这正是过去 dLLM 的弱势区间。

LLaDA2.2 的起点是 LLaDA2.1 的 8K,目标是 128K,跨度 16 倍。上下文扩展并不只是把窗口参数改大。模型的位置表示、注意力分布模式、块扩散的去噪行为都需要随之调整。

为此,研究团队采取的是分两级推进的方法:先在 64K 长度上续训 300B token,再扩展到 128K 上续训 200B token。

训练数据的组织也有讲究。这一阶段以长文档和仓库级代码为主,重点是有效长度真正落在 64K 至 128K 区间的样本。拼接时采用文档感知的 packing 与注意力边界,也就是让每篇文档只关注自己范围内的内容。

这一点对扩散模型尤为重要:扩散模型的注意力是双向的,如果不设边界,同一个 batch 里拼在一起的无关文档会相互「看见」,模型学到的会是虚假的双向依赖关系。

Agent 数据被安排在最后的 128K 阶段才加入,包括长软件工程上下文、工具使用轨迹和浏览轨迹。这个顺序是有意的:先让模型把长上下文的基本能力练稳,再教它在长上下文里做 Agent。最终模型才能实现原生支持 128K 的上下文长度。

更棘手的问题出现在 MoE 架构上,而且这个问题是块扩散特有的。

MoE 的工作方式是每个 token 只激活一小部分专家,比如从 256 个专家里选 8 个,以此在参数总量很大的同时保持单次计算量可控。自回归模型每步只生成一个新 token,激活的专家自然也就是那 8 个左右,负载稳定。但块扩散一步要并行处理整个块,通常是 32 或 64 个 token。如果块内每个 token 各自独立挑选专家,那么这个块实际需要加载的专家,就是所有 token 选择结果的并集。

若每个 token 各自独立路由,一个块触及的专家集合就是所有 token 选择的并集,后果是 HBM 流量上升、专家权重复用率下降、专家并行下的 dispatch/combine 通信成本增加。为了保证模型的吞吐、延迟与首 token 时间,研究团队采用了一种Block Routing (块路由)的设计。

打开网易新闻 查看精彩图片

Block-diffusion MoE 中 Block Routing 过程示意。

Block Routing 的设计依据是团队在 LLaDA2 系列上的一项实测:尽管 token 级路由整体呈现分散状态,但同一块内部的专家偏好高度集中,少数专家承担了大部分路由流量。据此,固定容量的块级专家池成为块扩散推理的合理选择。

具体做法是让路由单元与扩散生成单元对齐。块级准入分数通过 token racing 策略计算:

打开网易新闻 查看精彩图片

即每个 token 都有机会提名自身偏好强烈的专家。块随后按 g 准入 top-C 个专家,形成固定容量专家池 P。

该设计为每个块提供了可预测的专家工作集上界 O (C),改善了显存规划与专家并行执行;同时 token 级选择在准入池内依然保留,模型并未将路由退化为单一的块级决策,token 级专精得以保持。技术报告中表示,在后训练之后切换到 block routing 对模型质量几乎没有损害。

原生长上下文真正决定了扩散模型具备智能体领域工程部署的价值。上下文与成本这两个条件同时满足之后,模型能力才能转变为可以在成本敏感场景中落地的工程能力。

与自回归模型正面竞技

评测覆盖 17 个基准,其中 7 个 Agent 类、10 个通用类,与同参数的自回归模型 Ling-2.6-flash 进行比较。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

7 项 Agent 基准上,LLaDA2.2-flash 平均 53.83,Ling-2.6-flash 为 55.74,分数非常相近。

・τ²-Bench(多轮工具 - Agent - 用户交互):80.33 vs 76.36,领先

・PinchBench(真实场景 AI 编码基准):81.66 vs 81.30,领先

・MCP-Atlas(真实 MCP server 工具能力):46.21 vs 41.12,领先 5.09 分

・Claw-Eval(自主性):64.22 vs 64.56,基本持平

LLaDA2.2-flash 在交互式工具使用任务上具备非常强的竞争力。

打开网易新闻 查看精彩图片

长上下文能力同样得到验证。10 项通用基准中,LLaDA2.2-flash 在 LongBench v2 上以 45.13 反超 Ling-2.6-flash 的 42.94,与 128K 上下文扩展的目标相吻合。

打开网易新闻 查看精彩图片

效率,是扩散语言模型的传统强项,LLaDA2.2-flash 在保证基准能力不掉队的情况下实现了超高的效率。

BF16 平均吞吐量达 Ling-2.6-flash 的1.64 倍;FP8 量化后额外提升 18.6%,并且任务越重、上下文越长,扩散并行解码的优势越明显。

这是一次效率与 Agentic 能力的双重证明:性能与顶尖自回归模型处在同一区间且在关键交互任务上领先,吞吐则是对方的 1.64 倍。在成本敏感的 Agent 部署场景中,这一组合具备直接的现实价值,尤其是 Agent 任务往往需要在单次会话里完成数十轮推理,吞吐上的倍数差异会逐轮累积为端到端延迟和成本的显著差距。

更多信息,请参阅原论文。

结语

扩散语言模型一直是一个偏科生。效率上的巨大优势,似乎是由绝对能力换来的。

但当 LLaDA2.2 证明了扩散语言模型能够胜任智能体任务的时候,其效率上的绝对优势就完全无法忽视了。

对于正在评估 Agent 技术路线的团队来说,LLaDA2.2 已经不仅仅限于一个研究样本,而是一个可以被认真放进候选名单的基础模型选项。

自回归与扩散这两条路线的竞争还会持续很久。但可以确定的是,Agent 时代正在重新定义什么才是一款真正优秀的模型。它需要的不只是一个能够把答案说得漂亮的生成器,更是一个能在漫长任务中持续判断、发现错误、修正方向,并始终记得最终目标的执行者。

在这个新的评价标准下,会自我修改的模型,或许才刚刚开始展现它真正的想象空间。