大语言模型的推理速度,一直是落地应用的瓶颈。传统方法一次只能生成一个token,就像排队过闸机,效率上不去。现在,一篇新论文提出了一种名为Uno的扩散增强LLM,实现了无损的并行token生成,在多个评测场景下,速度最高提升到基础模型的3倍

这项工作的核心思路,是绕开现有加速方案的两难困境。此前流行的投机解码(speculative decoding)方法,通常需要一个额外的、更小的草稿模型来预测多个token,再由大模型验证。而扩散LLM(diffusion LLM)虽然能并行生成,但往往以牺牲生成质量或模型能力为代价。Uno的贡献在于,它同时避免了这两种代价。

打开网易新闻 查看精彩图片

Uno的工作原理:一套参数,两种用途

Uno被定义为一类扩散增强的大语言模型。它首先定义一个自回归(autoregressive)模型分布,然后利用扩散过程,从这同一个分布中并行抽取多个token。关键在于,模型的参数被分成了两部分:一部分是标准的自回归权重,按照常规的下一token预测任务进行训练;另一部分则是一组轻量级的扩散权重,通过一个简短的蒸馏阶段加入。

这个蒸馏阶段带来的额外开销很小,几乎可以忽略不计,却能无缝集成到现有的训练流程中。更重要的是,因为采样器直接从自回归分布本身进行采样,所以这种加速是无损的。这意味着,一个现有的开源权重自回归模型,可以直接升级为Uno,而无需从头重新训练。

实测性能:全面领先,最高3倍加速

论文给出的评测数据显示,Uno在每一个评估的批次大小下,都优于主流的投机解码方法,包括设备支持的最大批次。相比基础模型,Uno最高能实现3倍推理加速。

在模型规模的对比上,一个8B参数的Uno模型,在智能体工具使用、代码生成和长上下文推理等任务上,表现超过了26B参数的DiffusionGemma,以及专有的Mercury 2模型。这组对比直观地展示了Uno在效率与性能平衡上的优势。

这项技术的意义:推理成本的重新计算

对于开发者而言,这项技术的价值在于,它提供了一条清晰的升级路径。不需要推翻现有的模型架构,不需要重新训练庞大的模型,只需在现有模型上增加一个轻量级的蒸馏步骤,就能获得显著的推理速度提升。这直接关系到推理成本的计算——同样的硬件,单位时间内能处理更多的请求,或者用更少的硬件支撑同样的业务量。

论文已经公开在arXiv上(编号:2609.04010),相关讨论也可以在dair.ai的论文社区中找到。对于正在为推理延迟和成本头疼的团队来说,Uno提供了一个值得关注的方案。