缓存涨价背后,是大模型的存储与数据搬运困境。
打开网易新闻 查看精彩图片
缓存涨价背后,是大模型的存储与数据搬运困境。

作者丨高允毅

编辑丨岑 峰

一直以来,DeepSeek都是白菜价的代名词,这次它开始涨价了,而且还按时间段收钱。

8 月 17 日,DeepSeek V4 Pro API 的输入和输出价格涨幅如下图。其中,最便宜的缓存命中价格在空闲时断直接涨了5倍,在高峰时期,它竟然涨了11倍,从0.025 元 / 百万Token 涨至 0.3 元/ 百万 Token。

打开网易新闻 查看精彩图片

很多人或许并不了解“缓存命中”是什么。简单理解,它就像大模型的“草稿纸”,AI 每次回答问题时,不必每次都去重新翻阅所有信息。只要它之前计算过一次,这段长文本就会以“KV单元”的形式沉淀在存储集群里,后续调用直接提取即可。

一直以来,极高的缓存命中率是DeepSeeek最出圈的“性价比杀器”,它依靠极致的KV压缩技术和冷热记忆分层搬运架构,直接省掉了这部分海量的重复计算,把长文本的调用门槛控制到可以忽略不计。

正因如此,无数市面上的代码助手、知识库 Agent、长文档分析这样有着超长上下文的产品,通过薅DeepSeek的羊毛撑起了自己的盈利模型。而过大的需求量也直接把低廉的缓存命中变成了厂商不堪重负的刚性开销。

大模型的成本结构,正在发生历史性的变化:“算力(FLOPs)”正变得日益廉价,而“状态”的保存、带宽和数据搬运,正在成为AGI时代最昂贵的成本。

打开网易新闻 查看精彩图片

01

缓存命中到底帮 GPU 省掉了什么?

在没有缓存命中之前,很多人是用不起长上下文大模型的。

我们可以算笔账,假设你要用DeepSeek V4 Pro搭建一个代码库智能 Agent,核心代码有 50 万 Token,开发者一天问 50 轮。

在没有缓存的情况下,每一轮对话 AI 都要把这 50 万 Token 从头到尾完整计算一遍,50 轮下来累计输入就是 2500 万 Token,仅输入成本就超过 75 元。长此以往,光是调用模型就能吃掉产品的大部分利润。

但有了 90% 的缓存命中率,只有第一轮需要全额支付预计算成本,后续 49 轮里 90% 的上下文可以直接复用已计算好的状态,输入成本直降 90% 以上,几乎可以忽略不计。

这种夸张的省钱效率,背后靠的是 DeepSeek的KV压缩技术先把长上下文压缩,再靠冷热记忆分层搬运架构把存储成本打下来。

具体而言,大模型每读一个字都会产生庞大的记忆矩阵(KV Cache)。上下文越长,记忆矩阵占用的内存也更多,也会更贵。DeepSeek V4用了两种注意力架构交错配置,一个是压缩稀疏注意力技术(CSA),另一个是 重度压缩注意力技术(HCA)。能把相邻的 4 个甚至 128 个Token合成一个记忆块,直接把长文本的记忆体积直接缩小 95% 以上。这样超长的上下文变成了轻薄的压缩包。

由于压缩包足够小,服务器内部可以轻松搬动。DeepSeek又按照访问频率,把这些压缩后的记忆做了冷热分层存放。频繁被调用的 “热记忆” 留在昂贵但响应极快的 GPU 显存里,长期无人访问的 “冷记忆” 则被放到便宜、容量近乎无限的企业级 NVMe 固态硬盘中。这进一步节省了开支。

不过,缓存命中虽然省钱,不代表它免费。它帮 GPU省掉的是重复计算的算力的钱,但这又会在存储、搬运、调度三个环节中产生新的开销。

存储成本指的是海量 KV 状态要分层存储在 GPU 显存、CPU 内存和 NVMe 磁盘中;调度成本指的是每次请求要快速定位到对应缓存块、调度资源;IO 搬运成本指的是找到缓存后要从磁盘搬到内存、再加载到显存中。

这些成本之所以长期被开发者忽略,是因为它们一直很低廉。

DeepSeek V4 的 CSA+HCA 混合压缩技术,能把 100 万 Token 的 KV 记忆状态压缩到约 10GB 。在一块常用的均价为 6000 元的15.36TB 企业级 NVMe 硬盘计算,单份百万 Token 缓存的硬件分摊成本仅几分钱。

而单次磁盘到显存的搬运成本,算完电费与损耗,大约在几分钱量级。

这正是DeepSeek的缓存命中敢定价这么低的原因。

打开网易新闻 查看精彩图片

02

高峰期太堵,得交“存储税”

DeepSeek开始涨价,就是因为之前定价太便宜,太多开发者没有了成本顾虑,把整个代码库,Agent 多轮反思日志、全量行业文档…… 一股脑全往上下文里塞,这直接导致 DeepSeek 的后端服务器在高峰期陷入了严重的“缓存颠簸”

当高峰期,海量百万 Token 级的请求同时涌进来,GPU 显存(HBM)会在极短时间内被占满。为了给新请求腾地方,调度系统只能把长时间没人访问的缓存块,从显存里 “踢” 出去,转存到速度更慢但容量更大的 NVMe 磁盘上。

长上下文的缓存本身体积就不小,一次 “腾挪” 就要搬运上百兆甚至上 GB 的数据;而高峰期新请求源源不断,这种驱逐和加载的操作频率会指数级上涨。

vLLM 社区在适配 V4 的压测里,就记录过一个很典型的现象,在极端并发下,两个长上下文请求前后脚进来,就像早高峰涌入地铁的乘客,为了抢占一个临时的滑动窗口,会互相把对方原本占据了座位的公共前缀缓存挤出显存。用户隔一分钟发第二条消息,本该复用的缓存早就被踢去了磁盘,直接触发缓存失效,只能从头重新计算。

当数据在显存和磁盘之间频繁搬运,缓存不仅没起到加速省钱的作用,反而消耗了巨量的 IO 资源和调度算力,昂贵的GPU集群从计算推理的”脑力劳动者“变成了搬运数据的“体力劳动者”,算力在I/O堵塞中空转,严重的时候甚至会让整个集群的有效处理能力直接崩盘。

DeepSeek涨的价格就是这个存储税

或许会有人问,DeepSeek 不是已经在压缩上做到行业极致了吗,整套混合架构下来,1M Token 上下文的 KV 缓存体积相比 DeepSeek-V3 直接砍掉了 90%,和传统的 GQA架构相比只剩约 2%。

但问题是,被压缩的空间再小,也挡不住长上下文需求的指数级爆发,GPU 芯片总数、HBM 容量、总线带宽,都是有物理上限的。当存储、IO、调度这三类成本,大到一定程度的时候,DeepSeek必须涨价。

同样的难题,OpenAI 和 Anthropic 也躲不开。

为此,Anthropic用显式缓存断点机制,让开发者手动标记缓存位置,同时,首次写入缓存收取 1.25 倍或 2 倍的溢价,用高昂的首次写入成本,倒逼开发者自觉去优化架构,只缓存高频复用的前缀,减小后端的缓存压力。

而OpenAI赚得多,它的基础输入价格远高于 DeepSeek,可以配置更充裕的 HBM 显存加大缓存空间,以此降低后端的缓存压力。

只有DeepSeek因为真便宜,不得不涨价了。

打开网易新闻 查看精彩图片

03

开发者要省钱,得提高缓存命中率

有不少人看到DeepSeek涨价,可能会心里犯嘀咕,但DeepSeek即便涨价,依然是全球性价比最高的选择之一,成本只有Claude几分之一,甚至更低。

而且轻易换厂商并不划算。大多数公司已在 DeepSeek 的 KV Cache 层形成了稳定且高命中的缓存池,一旦切换到别家,成本代价也不低。

与其折腾换厂商,不如先吃透 DeepSeek 的缓存规则,把命中率拉到极致,把涨价多出来的成本再省回去。

DeepSeek 缓存的核心逻辑很简单,要前缀完全匹配,如果差一个字符都触发不了命中。很多开发者平时不注意细节,很容易踩坑,平白让几十万 Token 的缓存直接作废。

比如把当前时间、用户 ID、随机参数放在 Prompt 最开头,第一个字符变动,后面几十万 Token 的缓存直接全部作废。

或者在前端组件拼接时多了一个空格,换行符格式变了,在系统的字节匹配眼里,这就是完全不同的文本,缓存直接失效。

还有很多 Agent 框架会把工具返回的结果插到上下文中间,这一插就打断了后面所有历史内容的缓存边界,前面攒的长前缀缓存直接报废。

其实,DeepSeek的这波涨价,也在倒逼前端开发者的角色发生根本转变。

以前开发者调用大模型 API 很省心,写好 Prompt 发请求就行,后端显存怎么分配、缓存怎么调度都不用操心。但现在推理系统的底层,本质上已经变成了一个巨大的分布式存储系统,开发者必须要学会当 “数据管理员”。

哪些是全公司共用的核心热数据,要写在 Prompt 最前面,保证稳定命中;哪些是低频的冷数据,可以按需再加;缓存的生命周期怎么管理,才能避免高峰期被系统轻易 “踢” 出显存。

我们已经步入大模型精耕细作的时代,缓存命中就是其中一道重要的分水岭。

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈