Release Note 我扫了一遍,信息量确实不小——411 次提交、212 位贡献者,其中 61 位是第一次参与。

对比一下:v0.25.0 大概 300 次提交,这次直接跳到 411。61 位新面孔这个数字更值得注意——开源社区已经从核心团队维护进入了大规模协作阶段。

DeepSeek-V4 专项优化

vLLM 团队这次对 DeepSeek-V4 做了几处针对性优化:

专用路由内核:端到端 TPOT 提升 2.94%。这个数字对应的是 PR #48660,路由内核的专项调优。

fused_topk_bias:内核提速 1.5 到 2 倍(PR #47463)。

去冗余操作:移除重复的 repeat/copy,端到端 TPOT 再提升 1.8%(PR #48137)。

DeepSeek-V4 是 MoE 架构,专家多、路由逻辑复杂、通信开销大,推理引擎处理起来并不轻松。这几项优化加在一起,实际部署中生成速度会有明显改善。

Inkling 模型家族

v0.26.0 对 Inkling 提供了完整的支持栈:

基础建模(#48799)

分段 CUDA graph(#48822)

Hopper FA4 相对位置注意力(#48858)

MTP=1 投机解码(#48869)

LoRA 支持(#48884)

ModelOpt NVFP4 量化(#48990)

特别是 NVFP4——NVIDIA 的 4-bit 浮点量化格式,可以在不显著损失精度的情况下大幅降低显存占用。如果你在评估 Inkling 模型的部署方案,v0.26.0 是第一个可以认真看的版本。

KV Cache 分层存储

之前的版本里 KV cache offloading 就有了,但一直不太成熟。这次的更新把整个链路补齐了:

完整的 offloading 性能指标监控,包括读写延迟和命中率(#45958、#47666、#47679)

对象存储作为第二级存储,支持云端 S3(#47063、#47274、#48150)

DP 副本感知的分层策略(#47987)

编码器缓存的 CPU offloading(#42433、#47423)

这套组合的意思是:GPU 显存不够时,可以把不常用的 KV cache 放到 CPU 内存甚至远程对象存储,按需取回。并发量大的时候,不需要给每个请求都塞满 GPU 显存。

Rust 前端加入多模态

vLLM 的 Rust 前端之前主要处理文本推理的调度。这次加了视频(#47959)和音频(#48554)的支持,还包括 Seed-OSS 工具解析器(#47741)和原生的 vllm-bench 基准测试工具(#48107)。

Rust 前端的核心优势:用更少的内存和更高的一致性处理并发请求调度。

Transformers 5.13.0

这次迁移到了 Transformers 5.13.0(#47867),涉及的模型有:

Olmo / Olmo2:迁移到新的 Transformers 建模后端(#48100)

MistralLarge3:迁移到 AutoWeightsLoader(#48153)

HunyuanVL:迁移到 transformers 原生 processor(#47872)

三个模型的迁移路径并不完全相同,不是一句"新的 Transformers 建模后端"能概括的。Transformers 5.x 引入了新的 AutoWeightsLoader,模型加载方式变了,vLLM 需要逐个适配所有依赖这条链路的模型。脏活累活,但做完之后后续支持新模型会更顺畅。

我的判断

411 次提交不是小数字。从 DeepSeek-V4 的专项调优、Inkling 的全栈支持、到 KV cache 分层存储的完善,这个版本确实有实质内容。