先别急着堆GPU。

GitHub爆火的开源项目 LMCache,它干的事情就一句话:把大模型已经算过的内容缓存下来,下次直接复用,不再重复推理。

打开网易新闻 查看精彩图片

用户连续问同一个文档、同一个知识库,或者RAG系统不断检索同样的内容,传统方案每次都会重新做Prefill,GPU一次次重复干同样的活。

LMCache把这些KV Cache统一存储到GPU、CPU内存、磁盘,甚至S3等存储介质,需要时直接读取缓存,大幅减少重复计算。官方数据显示,与vLLM结合后,在长上下文、多轮对话、RAG等场景中,可实现3~10倍延迟优化,部分测试吞吐量提升甚至达到15倍。

打开网易新闻 查看精彩图片

它目前已经支持:

vLLM、SGLang等主流推理框架;

CPU、磁盘等多级KV Cache存储;

KV Cache共享、Prefill与Decode分离部署;

打开网易新闻 查看精彩图片

通过 pip install lmcache 即可快速安装体验。

简单来说,它更像是给大模型装了一套"缓存加速器"。

以前GPU一直在重复做同样的计算;现在只算一次,后面直接复用,既降低GPU压力,又能让用户更快看到模型回复。

打开网易新闻 查看精彩图片

对于做企业AI、知识库、Agent、多轮聊天、RAG应用的人来说,这类底层优化比单纯升级显卡更划算。