LM Studio 终于把 MTP(Multi-Token Prediction)推测解码做上了

事情还挺有故事性的:5 月 17 日 llama.cpp 合并了 MTP 支持,5 月 18 日就有用户在 LM Studio 的 issue 区开帖催更:

❝ "llama 合并 MTP 三天了,LM Studio 怎么还没支持?我快焦虑发作了,没有 MTP 我整个世界会塌的(我看到征兆了…),LM Studio 的开发者们要是能听见我说话,求求你们加上 MTP,我感觉留给我的时间不多了,请,LM Studio,救救我们。"

这哥们是真急

幸运的是,5 月 20 日 LM Studio 官方开发者 yagil 直接在 issue 下面回复:"Fear not, it is here (in beta)",0.4.14 Build 2 beta 上线,5 月 22 日 Build 4 正式稳定版发布

简介

先快速科普一下,MTP(Multi-Token Prediction)是什么

简单讲就是:传统语言模型一次只能预测一个 token,每生成一个字都要把整个网络跑一遍,慢。MTP 让模型一次预测多个 token,然后用验证机制保证质量,本质上是推测解码(speculative decoding)的一种,但比传统的 draft model 方案更优雅

它有两个好处:

  • 不用额外的 draft 小模型:MTP head 是和主模型一起训练的,自带"草稿能力"

  • 天然对齐:因为是同一个模型出来的预测,验证通过率高,加速倍数稳定

怎么开启?六步打开 MTP

这里有几个坑要避开,按官方和社区实测的步骤来:

  1. 升级 LM Studio 到 0.4.14 Build 4

打开网易新闻 查看精彩图片
  1. 打开 LM Studio,开启 Developer Mode(开发者模式)

打开网易新闻 查看精彩图片
  1. 打开网易新闻 查看精彩图片

  2. 下载支持 MTP 的模型 推荐:

  • unsloth/Qwen3.6-35B-A3B-MTP-GGUF

  • unsloth/Qwen3.6-27B-MTP-GGUF

上一篇刚介绍过 ,作者也发了 MTP 头版本,吞吐能跟 Qwen3.6 官方 MTP 跑出 1.66× 的对比

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

❝ ⚠️ 关键提示:普通 GGUF 模型开 MTP 不会变快,反而可能更慢,必须是带 MTP head 的专用 GGUF。这点社区已经有不少坑货反馈了
实测速度有多炸?

直接看社区跑出来的数据:

硬件

模型

不开 MTP

开 MTP

加速比

RTX 3090

Qwen3.6-27B MTP

~20.69 tok/s

~42 tok/s~2.0×

高端配置

Qwen3.6-35B-A3B MTP

~130 tok/s

已知问题(提前避坑)

按 issue 区扒下来的踩坑清单:

问题

状态

Build 2 代码输出空白符被吞掉

✅ Build 3 已修复

非 MTP 推测解码在 MTP 开启时报错

✅ Build 4 已修复

小模型(4B 级别)MTP 反向加速

⚠️ 待优化,建议先用大模型

Gemma 4 MTP 不可用

⚠️ 已知 bug

MTP 默认关闭,新手容易找不到

⚠️ 必须开 Dev Mode + 选加载参数

llama.cpp 引擎版本要求 2.15.0

⚠️ 在 beta 频道,部分人要手动升级

和原生 llama.cpp 对比

也有网友提到一个值得关注的点:原生 llama.cpp 命令行可以用ubatch等更多调参选项,理论上优化空间比 LM Studio 大

我感觉这个需要分场景:

  • 想最快上手、不折腾:LM Studio 0.4.14 + MTP 一键开,无脑享受 2× 提速

  • 想压榨到极限:还是回到 llama.cpp 原生命令行,手动调 ubatch、n_gpu_layers、KV cache 这些

  • 配合 froggeric 修复模板:Qwen-Fixed-Chat-Templates 在 LM Studio 上也能用,工具调用稳定性能再上一档

.cpp

制作不易,如果这篇文章觉得对你有用,可否点个关注。给我个三连击:点赞、转发和在看。若可以再给我加个,谢谢你看我的文章,我们下篇再见!