开发者FareedKhan完成了一项极限实验:在仅8GB内存、不使用任何GPU的环境中,成功运行了月之暗面旗下Kimi K3大模型。代价是每生成一个Token需要33秒——这意味着完成一段百字回复,大约需要等待一个小时。

整个项目的核心技术思路,是绕开显卡、深度学习框架与BLAS库的依赖,用纯C99编写推理引擎,在单颗CPU加少量内存的条件下跑通推理流程。开发者明确表示,项目目标不是追求实用性能,而是通过亲手实现推理流程来理解Kimi K3的混合专家架构,同时验证超大规模模型在低内存设备上运行的可行性边界。

打开网易新闻 查看精彩图片

Kimi K3的模型检查点体积约为1.56TB,其中约93%是路由专家权重。模型每生成一个Token时,896个专家中仅激活16个。项目利用这一特性,没有将全部专家权重加载进内存,而是将其以打包的4-bit格式保留在NVMe固态硬盘中,推理时按需从硬盘读取并直接参与乘法运算,省去了常规的完整反量化步骤。模型的稠密主干部分则被重新打包为单文件,各层权重按偏移量排列,推理时一次流式读取一层。用户可以通过设置内存预算,在内存占用与运行速度之间自行取舍。

打开网易新闻 查看精彩图片

测试环境搭载两颗AMD EPYC 7763处理器与NVMe SSD,机器内四张GPU全程未被调用。在最小内存预设下,进程峰值内存占用仅8.24GB,此时每个Token生成耗时约33秒。如果将内存预算放宽至128GB且继续不使用GPU,速度会提升至每Token约20秒,但继续增加内存已无法进一步提高吞吐效率——开发者的测试表明,存储读取与CPU计算此时已成为主要瓶颈。

一个值得关注的细节是:在不同内存预设下,模型的输出结果保持字节级一致。这意味着调整缓存策略和权重读取方式虽然会影响速度,但不会改变模型推理的结果本身。这也反向印证了,当前这套极限低配方案的核心瓶颈,确实卡在数据搬运和算力上,而非推理逻辑的完整性受损。