当大模型参数规模从百亿迈向万亿,普通电脑因显存不足只能望而却步,“上云”似乎成了唯一选择。但 GitHub 上斩获 3.1 万+ Stars 的开源项目 Colibrì 打破了这一认知:它让消费级电脑也能运行远超自身内存容量的 MoE 大模型,目前已支持 GLM-5.2(744B)、Kimi K3、DeepSeek V4 Flash、Qwen3.6 等模型,甚至可承载 2.8T 参数级 MoE 架构。其核心并非强行塞入显存,而是将 VRAM、RAM、NVMe SSD 统一为分层内存系统,按需加载而非全量驻留。

打开网易新闻 查看精彩图片

核心原理:把硬盘变成“慢显存”

传统推理要求模型权重全部载入 RAM/VRAM,而 Colibrì 抓住 MoE 模型“总参数大但单次激活专家少”的特性,构建了三层统一内存体系:高频数据驻留 VRAM/RAM,低频专家权重暂存 NVMe SSD,仅在需要时动态读取。这并非将 744B 参数压缩进 25GB 内存,而是实现“用什么加载什么”的智能调度。项目还内置 LRU 热点缓存、Expert Prefetch、异步 I/O、Batch Union 及 CPU/GPU 协同机制,并会学习用户习惯,将常用专家逐步固定至高速内存层,持续降低磁盘 I/O 等待时间。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

硬核实现:纯 C 引擎与零依赖推理

Colibrì 采用纯 C 语言编写,不依赖任何第三方推理引擎,最初即在 12 核 CPU + 25GB RAM + 普通 NVMe SSD 的机器上开发验证。早期基准测试显示该配置运行 GLM-5.2 速度约 0.05 ~ 0.1 token/s;在 128GB CPU 主机上可达 1.8 tok/s,6×RTX 5090 全驻留配置则达 5.8 ~ 6.8 tok/s。它并非宣称“25GB 内存流畅跑 744B”,而是证明硬件不足不等于完全不可行——速度慢一点,远比直接放弃更有价值。这种对底层资源的极致掌控,使其更像一个重新定义“内存”概念的推理实验场。

打开网易新闻 查看精彩图片

使用体验:从命令行到可视化 Brain 页面

项目提供 Linux/macOS/Windows 预编译版本,解压即用,无复杂运行时依赖。启动 ./coli chat 即可本地对话,./coli web 则打开浏览器 Web UI,实时展示 Token 生成速度、TTFT、各层内存占用及专家路由状态。其中最引人注目的是 Brain 页面,可直观观察模型内部哪些专家正在被激活,让黑盒推理过程变得透明可感。对于开发者而言,这不仅是一个聊天工具,更是理解 MoE 动态行为的窗口。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

深层意义:为大模型膨胀时代探路

Colibrì 的真正野心不是成为另一个 Ollama,而是探索超大模型在有限硬件下的生存策略。随着模型规模向 2T、10T 演进,“全量塞入显存”的路径成本将急剧攀升。Colibrì 提出的分层内存、智能预取、异构协同等思路,恰恰回应了这一趋势:模型可以很大,但不必所有参数同时占据最快存储。它把问题从“能不能跑”转化为“如何优雅地跑”,为未来个人设备承载更大智能提供了技术雏形。

最后

我觉得 Colibrì 最动人的地方,不是 25GB 跑 744B 的数字奇观,而是它对“不可能”的温柔反抗。当行业默认超大模型属于云端专属时,它用纯 C 代码和一块 SSD 证明:普通人的电脑依然有参与前沿 AI 的权利。

这或许正是开源精神最珍贵的部分——不以性能碾压为目标,而以可能性拓展为使命。即使今天只有 0.1 tok/s,那也是通往未来的一步。当显存不再是门槛,大模型的民主化才真正开始。

一句话总结:Colibrì = 一个用分层内存让普通硬件运行超大 MoE 模型的纯 C 推理引擎,重新定义了“显存不够”时的解题思路。

项目地址:https://github.com/JustVugg/colibri 官网演示:https://justvugg.github.io/colibri

如果以后真的可以用一台普通电脑运行 2T 参数大模型,你会选择本地部署,还是继续使用云端 AI?