一个27B参数的大模型,体积从54GB压到7.89GB,然后跑在一台16GB内存的普通笔记本上。这不是概念演示,是已经放出来的预览版模型,名字叫Saluki。

它的底座是Qwen3.8-27B,做法是约2-bit量化。体积缩了将近7倍,硬件门槛跟着一起掉下来——16GB内存的设备就能本地跑起来,兼容llama.cpp,适合自己部署。

它到底能干什么

官方给出的定位很明确:本地Agent和工具调用。这类场景不需要模型什么都懂,但需要它在关键动作上别掉链子。

看数据,工具调用选择正确率是47/48,这个数字相当能打。编程修复任务上,SWE-bench拿到30/50,全精度原模型是33,差距不大。

换句话说,在它主打的这两件事上,压缩带来的损失被控制住了。

代价也很清楚

数学能力保留原模型的82%–85%,这个降幅不算小。复杂并行工具调用则卡在格式解析上:严格评分只有42/100,换成宽松格式解析能提到55/100。

也就是说,模型知道该调什么工具,但多个工具一起调的时候,输出格式容易出问题。这是量化之后比较典型的瓶颈。

整体基准略逊于全精度版本,这个结果不意外。取舍的逻辑是:牺牲一部分通用能力,换本地可运行。

为什么这件事值得看一眼

27B级别的模型过去基本和消费级笔记本无缘,要么上云端,要么配大显存。7.89GB这个体积把门槛拉到了另一个区间。

目前Saluki是Apache 2.0许可的预览版,可以自由使用和修改。对想在本地搭Agent、又不想依赖云服务的人来说,这是一个新的选项。

它不完美,数学弱了,并行调用还不稳。但它证明了一件事:把大模型塞进普通电脑,路子是通的。