来源:市场资讯

(来源:AI信息Gap)

每秒 1107 个 token vs 303 个。

同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。

DiffusionGemma,谷歌刚刚发布的新模型,比标准版 Gemma 4 快了将近 4 倍。

它不再一个一个 token 往外蹦了。256 个 token,同时生成。

完全开源,Apache 2.0 协议。

打开网易新闻 查看精彩图片

目前主流大模型生成文字的方式,都像打字机。

一个一个 token,从左到右,前一个出来了才能生成下一个。GPT 这样,Claude 这样,DeepSeek 也这样。这种方式叫「自回归」。

但本地运行模型的时候,这种方式有个天然的瓶颈。「GPU 大部分时间在等上一个 token 算完,才能算下一个。」算力利用率低,显卡在空转。

云端可以同时接几千个用户的请求,把 GPU 喂满。但本地只有你一个人用,速度上不去。

DiffusionGemma 换了一条路。

图片模型生图,一开始都是一张噪点图,然后一步步去噪,最终变成清晰的画面。DiffusionGemma 把同样的思路搬到了文字上。

一开始,它先生成 256 个随机占位符。然后反复迭代。每一轮把已确定的 token 锁住,用它们当线索,修正剩下的。几轮下来,一整段文字就出来了。

这样一来,打字机变成了印刷机。一次能印一整版。

以前是串行,现在是并行。

以前生成 256 个 token,模型要一个一个计算 256 次。现在几轮迭代就搞定,GPU 终于不用空转了。而且因为 256 个 token 同时存在,每个 token 都能看到其他所有 token,形成了「双向注意力」。这是自回归模型做不到的。它生成第 50 个 token 的时候,第 51 到第 256 个还不存在。

「双向注意力」带来了一个实打实的好处。

你给它一段代码,中间挖掉一块,让它填。自回归模型只能从左到右一个一个猜。DiffusionGemma 能同时看到前后上下文,直接填进去。

代码补全、行内编辑、数学公式、结构化数据,这些「非线性」任务,天然适合扩散模型。

打开网易新闻 查看精彩图片

Unsloth 团队用 DiffusionGemma 微调了一个数独求解器。自回归模型解数独很吃力,因为每个数字都依赖后面还没生成的数字。扩散模型直接统筹全局,一次填完。

DiffusionGemma 速度极快。H100 上能达到 1107 tok/s,RTX 5090 700+ tok/s。

但,智商打了折扣。

打开网易新闻 查看精彩图片

MMLU Pro 研究生级知识测试,DiffusionGemma 77.6%,标准 Gemma 4 82.6%。

AIME 2026 数学推理,69.1% vs 88.3%。差了将近 20 个百分点。

LiveCodeBench v6 竞赛编程,69.1% vs 77.1%。

GPQA Diamond 科学推理,73.2% vs 82.3%。

每项都低那么一点。谷歌自己也说,这是实验性模型。需要最高质量输出的场景,还是用标准 Gemma 4。

打开网易新闻 查看精彩图片

「用速度换智商。将近 4 倍速度,八成智商。」

这笔账划不划算,取决于你用它来做什么。

实时交互、代码补全、快速迭代,1107 tok/s 的速度优势是碾压级的。

写论文、解竞赛题、做复杂推理,标准模型仍然更靠谱。

DiffusionGemma 的底座和 Gemma 4 26B 一样,总参数 26B,混合专家(Mixture of Experts,MoE)架构,推理时只激活 3.8B 参数。

量化之后占用大约 18GB 显存。

RTX 5090 32GB 没问题。RTX 4090 24GB 也装得下。

谷歌和英伟达一起做了优化,支持 NVFP4(4 位浮点)加速,消费级显卡就能跑起来。英伟达的 DGX Spark 桌面工作站也能跑到每秒 150 个 token,DGX Station 直接拉到 2000 tok/s。

Hugging Face 已经可以下载。Unsloth 发布了 GGUF 量化版本。vLLM、MLX、Hugging Face Transformers 全部支持。

DiffusionGemma 抱抱脸下载地址:https://huggingface.co/google/diffusiongemma-26B-A4B-it

谷歌的 Gemma 4 家族今年已经发布了五款模型。从手机端的 E2B 到桌面端的 31B,再到上周的无编码器 12B。

DiffusionGemma 是第六位成员,也是画风最不一样的一个。

前面五个拼的是智商。这个主打一个速度。

我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。