想本地跑大模型,硬件配置往往跟着模型规模一起攀升。

参数越大,对显存、算力和整机性能的要求就越高。

至于千亿参数级别的旗舰模型,在家用电脑上跑,那更是想都不敢想

今天介绍的开源项目:Colibri 则提出了不一样的思路。

打开网易新闻 查看精彩图片

01 项目介绍

Colibri 是一个用纯 C 写的专跑 MoE 大模型推理引擎。

MoE 架构特点:

744B 参数的模型,每生成一个 token,真正激活的参数只有约 400 亿。

而激活这一部分,相邻的两个 token 之间被换掉的大约只有 11 GB。

打开网易新闻 查看精彩图片

02 项目亮点

1.磁盘流式加载专家:

Colibri 把显存、内存和硬盘看成同一层存储。

模型权重以 int4 格式躺在 NVMe 上,需要哪层专家就按路由热度流式读上来。

它还会把我们常用的专家记一个学习缓存,每次对话更新,并把最热门的专家记在内存里。

2.压缩状态,不篡改模型:

KV 缓存比原来压缩了 57 倍。

每个 token 为 576 个 浮点数,而非原本的 32768 个。

并支持跨重启持久保存 :

对话可暖启恢复,不需重新预填充,结果与之前相同。

3.原生 MTP 推测解码:

GLM-5.2 原生 MTP head 会起草 token,再由主模型一次前向验证 2.2 到 2.8 个 token。

PS:MTP head 必须是 int8,选错就不会有作用。

4.OpenAI 兼容 API:

上述命令可以起一个 OpenAI 兼容的 API。

任何支持自定义 OpenAI 端点的客户端都能接入。

03 快速入门

1.前置: 程序(几百 KB)和模型(372 GB)。

2.安装:

从 Releases 下载对应平台的预编译包,Linux、macOS、Windows 都有:

mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibripython3 coli info # engine ready ✓

解压即用,只需装好 Python 3 就行(Python 只负责启动器和 API 网关)。

至于模型,在 Hugging Face 上有转好的 int4 版本,约 372GB:

也支持自己从 FP8 源转换,无需一次性腾出 756GB:

./coli convert --model /nvme/glm52_i4 # 逐 shard 下载并转换(仅此一次需要 python)

3.运行:

COLI_MODEL=/nvme/glm52_i4 ./coli chat # 自动检测 RAM 预算、缓存与 MTPCOLI_MODEL=/nvme/glm52_i4 ./coli plan # 查看规划的 VRAM/RAM/磁盘配置COLI_MODEL=/nvme/glm52_i4 ./coli doctor # 只读就绪检查./coli web --model /nvme/glm52_i4 # 在同一端口提供 API 与网页仪表盘./coli serve --model /nvme/glm52_i4 # 仅提供 OpenAI 兼容 API

04 结语

Colibri 价值在于:25 GB 内存也可以跑千亿参数大模型。

如果你也硬件有限,但又想持有而非租用智能,不妨试试。

谢谢你阅读我的文章~

我们下期再见!