一个接近1.5TB的模型,被压到214GB之后,在一台只有单张4090的笔记本上跑出了1.02 token/s。这不是实验室里的理论推演,而是腾讯混元团队今天发布的Hy4 preview轻量版给出的实测结果。
Hy4 preview是腾讯8月28日发布并开源的新一代MoE大语言模型,总参数量7700亿,激活参数49B,上下文长度100万Token。这次轻量版的核心变化只有一个:把模型权重从接近1.5TB压缩至约214GB,压缩率超过85%。
两项压缩技术怎么配合
这次压缩不是简单砍参数,而是靠两项技术叠加完成。第一项是Sherry稀疏三值量化算法,把路由专家层权重压缩到平均1.25比特。第二项是MIX-STQ1_0混合精度策略,依据校准数据逐层决定每层的量化位宽——敏感层保留2.06比特的IQ2_XXS精度,不敏感层则用更激进的1.31比特STQ1_0。
两种策略配合下来,模型在主流任务上的表现没有出现断崖式下滑。长文理解几乎与原始BF16模型持平,多轮长上下文检索基本在同一水平,数学能力仅小幅回落。具体到基准测试:MCP Atlas得分从83.7微降至83.2,SWE-Bench multi从82.9降至81.3。
异构设备联合推理的实测方案
更值得关注的是异构设备联合推理的验证。腾讯混元与prima.cpp合作,在一台单张4090的笔记本和一台四卡A4000服务器上做了测试。两台机器合计80GB显存、64GB内存,而且分属两个局域网。
通过prima.cpp的异构调度,MoE层被拆分分配到这两台设备上,214GB的轻量版模型最终跑出了1.02 token/s的推理速度。这个数字单独看不算快,但对比笔记本单机offload方案,速度提升了约6倍。
开源生态的落地情况
轻量版模型已经上线Hugging Face和GitHub,支持llama.cpp、vLLM、SGLang等主流推理框架。量化GGUF文件、原模型权重和AngelSlim代码仓库都已公开。
从1.5TB到214GB,这次压缩的意义不只是省存储空间。它让原本需要多卡服务器才能加载的7700亿参数模型,有了在消费级硬件上运行的可能。单张4090加一台四卡A4000的组合,跑出1.02 token/s的速度,对于需要本地部署长上下文模型的开发者来说,至少多了一个可以实际动手验证的选项。
热门跟贴