2026年7月初,有位开发者在Reddit发帖讲,他用一张二手的RTX 5060 Ti 16G显卡跑通了Qwen3.5 35B A3B float8模型,这张卡二手价格在3600块上下,属于中端显卡里的常见配置,他没放录屏视频,只给出实际测试的数据,平均生成速度是55 tokens每秒,最快那次达到61 tok/s,这个表现已经能基本应付日常对话,比过去用4090运行同等级模型还要快不少。
很多人可能不知道,Qwen3.5 35B这个模型采用MoE架构,总共有350亿参数,但每次生成内容时只调用其中约30亿参数,这种设计被称为A3B模式,这样计算量就减少了,但问题在于float8格式下整个模型的权重仍然占用35GB显存,而他的显卡只有16GB容量,按理说根本放不下,这就引出关键点——他没有更换显卡,而是使用了一个叫"Garlic"的开源推理引擎来处理这个问题。
Garlic引擎不是通用工具,它是专门为Qwen3.x的MoE架构设计的,这个引擎内置了Gated Delta Network核心,可以更智能地分配参数和安排计算流程,例如决定哪些专家模块需要开启或关闭、什么时候加载或卸载资源,这些都比llama.cpp或Ollama这类传统框架更加准确,目前测试中还未启用MTP功能,这意味着未来还有提升性能的空间。
显存不够的时候,Garlic用了隐藏的方法,把一部分权重放到系统内存里,要用的时候再动态拉回显存,就像手机应用在后台挂着,需要时才重新启动,这种显存和内存一起用的方式,让16GB的显卡也能运行35GB的模型,但具体怎么分片、怎么交换,开发者没有详细说明,现在还属于黑盒操作。
但别高兴太早,这套方案现在很难用,得手动编译代码,安装一堆依赖库,还要在Linux环境里折腾,有人试了几次都失败,报错信息五花八门,模型权重在国内下载也不方便,得靠镜像站中转,普通用户想拿来玩基本不可能,连技术爱好者都得花半天时间配置环境。
从横向来看,以前跑35B模型基本要用到4090显卡,或者干脆用CPU慢慢算,速度通常不到每秒10个token,现在一张3600块钱的卡就能跑到55 token每秒,确实是质的变化,这说明硬件门槛正在被软件突破,不是所有大模型都得堆显存,关键是怎么把已有的资源用好。
我发现Qwen3.5 A3B的总参数比Mixtral 8x7B多很多,但它每次激活的参数数量少,更适合显存小的设备使用,国外的主流做法是增加单个专家的容量,我们这边却朝着稀疏激活的方向发展,这可能不是技术上的落后,而是选择的发展路线不同,要是将来真的研发出"动态参数路由器"专用芯片,很可能就是从这类实践当中产生的。
GitHub上已经有了garlic-inference这个项目,作者提到后续会写技术博客说明原理,Reddit上的帖子有54个赞,讨论挺热闹,不过离一键安装还差得远,至少得解决三个问题,编译封装太复杂,模型适配还没标准化,错误处理机制比较弱,现在它更像是个技术验证,不是成型的产品。
有人问系统会不会很快支持Windows,目前还没有消息,但既然已经开始开发,后续版本跟进应该只是时间问题,毕竟现在16G显卡就能运行35B模型,下一代中端显卡说不定真能当主力设备使用。
热门跟贴