一个1.5TB的模型文件,被压缩到约214GB,推理速度和精度却没怎么掉。这不是实验室里的理论推演,而是腾讯混元团队刚刚公开的Hy4 preview轻量化方案。
实现这一压缩的核心,是一套名为Sherry的稀疏三值量化算法。它把模型权重平均压缩到1.25比特,存储需求大幅下降。具体做法是把四个权重分成一组,强制保留一个零值,从而在极低比特率下维持推理效率。实测下来,它的速度和业界常用的IQ1_M格式基本持平,但比特数更低。
混合精度策略:逐层分配比特数
光有低比特还不够,团队又叠加了MIX-STQ1_0混合精度策略。这套策略的思路是:根据校准数据,逐层判断哪些层对精度更敏感,然后给敏感层分配更高的比特数(比如IQ2_XXS),给不敏感层用更低的STQ1_0。
这样做的效果很直接——在不增加平均比特预算的前提下,整体量化误差反而更低。落到最终模型上,MIX-STQ1_0的路由专家权重不仅评测表现更好,还比UD-IQ1_M格式少占了5个多GiB的空间。
精度损失:和原版差距在可接受范围
压缩之后,模型还能打吗?团队在长文理解、多轮检索和数学任务上做了对比测试。结果显示,量化版模型与BF16原版相比仅有微小差距,在主流任务上表现稳定。对于需要把大模型塞进有限存储或显存空间的场景来说,这个精度代价是划算的。
更值得注意的是,这套方案还顺带解决了超大模型的部署难题。利用prima.cpp框架,模型可以被拆分并分配给不同设备,实现跨异构设备的联合推理。这意味着,面对旗舰大模型,不一定非得采购整套同构硬件——把手边现有的异构设备拼起来,也能让它跑起来。
腾讯混元团队在技术报告中特别提到,STQ1_0在比特数最低的同时,速度和IQ1_M基本持平,明显快过同样想冲低比特的IQ1_S。这种"既要低比特又要速度"的组合,正是当前量化方案里最稀缺的部分。
对于正在做大模型落地的团队来说,这套方案提供了一个新选项:与其纠结于买多少张卡,不如先看看手里的硬件能不能通过量化+异构推理的方式,把模型跑起来。
热门跟贴