先别急着堆GPU。
GitHub爆火的开源项目 LMCache,它干的事情就一句话:把大模型已经算过的内容缓存下来,下次直接复用,不再重复推理。
打开网易新闻 查看精彩图片
用户连续问同一个文档、同一个知识库,或者RAG系统不断检索同样的内容,传统方案每次都会重新做Prefill,GPU一次次重复干同样的活。
LMCache把这些KV Cache统一存储到GPU、CPU内存、磁盘,甚至S3等存储介质,需要时直接读取缓存,大幅减少重复计算。官方数据显示,与vLLM结合后,在长上下文、多轮对话、RAG等场景中,可实现3~10倍延迟优化,部分测试吞吐量提升甚至达到15倍。
打开网易新闻 查看精彩图片
它目前已经支持:
vLLM、SGLang等主流推理框架;
CPU、磁盘等多级KV Cache存储;
KV Cache共享、Prefill与Decode分离部署;
打开网易新闻 查看精彩图片
通过 pip install lmcache 即可快速安装体验。
简单来说,它更像是给大模型装了一套"缓存加速器"。
以前GPU一直在重复做同样的计算;现在只算一次,后面直接复用,既降低GPU压力,又能让用户更快看到模型回复。
打开网易新闻 查看精彩图片
对于做企业AI、知识库、Agent、多轮聊天、RAG应用的人来说,这类底层优化比单纯升级显卡更划算。
热门跟贴