消费级显卡的显存天花板,被一张RTX 4090捅穿了。海外极客在Ubuntu系统上,用一张普通24G显存的RTX 4090,外加110G白菜价DDR4内存,把125B参数的Qwen 3.8 Flash Next模型跑了起来。上下文窗口直接拉到25万,解码速度稳定在每秒21个词。

过去跑这种百亿千亿级模型,通常要租几张A100组成数据中心集群。这次跑出的成绩单里,预填充速度达到每秒364词,解码速度每秒21词。更关键的是,全程没开MTP、没开dflash,连KV缓存都没做任何量化。

打开网易新闻 查看精彩图片

24G显存怎么塞下125B模型还带25万上下文

核心秘密藏在llama.cpp最新分支的一个参数里:-cmoe。这个功能把512个专家层全部卸载到廉价的系统内存,只把最吃计算的注意力机制留在4090显存里。显存占用从24G暴跌到11.6G,解码速度几乎没有损耗。

空出来的12G显存全部拿去放上下文,窗口一路顶到250,000的绝对上限。跑完之后,显存还剩5个多G的余量。再把batch设到4096,提示词处理速度直接翻倍。

消费级显卡能跑的模型规模被重新定义

以前大家普遍认为,消费级显卡只能跑7B到27B的小模型。这次MoE架构加上内存卸载的组合,把数据中心级别的模型能力塞进了家用电脑。本地折腾私有大模型和超长Agent的场景,门槛被大幅拉低。

整套方案的关键点可以拆成三块:

  • 512个专家层全部卸载到DDR4系统内存,注意力机制留在显卡显存
  • 显存占用从24G降到11.6G,空出的空间全部用于扩展上下文
  • batch设为4096后,提示词处理速度翻倍,解码速度保持每秒21词

从结果看,这套组合拳没有牺牲推理速度,也没有依赖量化手段。对想在本地跑大模型、处理超长上下文的开发者来说,硬件门槛第一次被压到了单张消费级显卡的级别。