一个2B参数的模型,量化后权重只有1.61 GB。这个体积意味着什么?普通消费级显卡的显存里,它能和别的任务挤在一起跑,不用独占整块卡。

这是社区为MiniCPM5-2B做的EXL3 4-bit量化版本,作者把权重压到了1.61 GB,同时给出了实测速度:在NVIDIA Tesla T4上跑到约68–70 tokens/s。

打开网易新闻 查看精彩图片

4.0 bpw是什么概念

这次量化用的是EXL3,精度标定为4.0 bpw,也就是每个权重平均占4个比特。比特数越低,模型文件越小,对显存和内存的压力也越小,代价通常是精度上的取舍——具体损失多少,量化方案本身决定了这个平衡点在哪里。

1.61 GB的权重体积,配合4.0 bpw的设定,指向的是同一个目标:让这个模型能在更轻量的本地环境里跑起来,而不是必须依赖大显存设备。

跑在什么上面

推理侧支持ExLlamaV3和TabbyAPI两个本地推理方案。T4是一块不算新的数据中心卡,在这个硬件上拿到68–70 tokens/s,说明这套量化在实际部署里是可用的速度,不是只能跑通demo的水平。

模型权重已经放上Hugging Face,页面地址为huggingface.co/ewin-reg/MiniC…,基座模型指向openbmb的MiniCPM系列仓库。

社区补上的那一块

官方发布基座模型,社区负责把它改造成各种能落地的形态——量化版就是其中最常见的一种。这次EXL3 4-bit版本的价值不在于提出了新架构,而在于把MiniCPM5-2B塞进了更小的空间里,同时保住了可用的推理速度。

对想在本地跑模型的人来说,1.61 GB这个数字本身就是门槛:它决定了你能不能在已有的机器上多挂一个模型,而不是为它单独配一台设备。