智能体流量已经占全部推理流量70%以上。这个数字来自SemiAnalysis,它把智能体负载的特征拆成了四条,每一条都指向同一个问题:推理的账,和以前不一样了。

先看这四条特征分别是什么。

打开网易新闻 查看精彩图片

多轮:一次会话几十上百轮

一个会话里包含几十甚至上百轮交互。轮数一多,KV缓存的复用潜力就被放大了——同样的上下文,理论上不必每一轮都从头算一遍。

这是智能体负载和传统单次请求最直观的差别。单次请求算完就结束,多轮会话则是在一条线上反复叠加。

上下文:系统提示、工具定义、轮数一起堆

系统提示词、工具定义,再加上大量轮次,让上下文快速累积。这三样东西叠在一起,上下文长度的增长速度远超普通对话场景。

上下文越长,重算的成本越高,缓存的收益也越明显。

高前缀复用:缓存输入占比趋近1

对话是线性推进的,第n-1轮的输出通常会拼接到第n轮。这意味着大部分上下文可以直接从KV缓存里取,而不是重新计算——前提是有足够的存储来放这些KV张量。

随着轮数n增长,已缓存输入相对未缓存输入的比例,通常会趋近于1。换句话说,越到会话后段,需要现算的部分越少。

子智能体突发:短命、全新上下文、缓存模式被打乱

一个会话会启动多个短命的子智能体,每个都带着全新的上下文。它们制造出突发性的KV缓存模式——不是平稳增长,而是一阵一阵地来。

这一条和前三条的方向不太一样。前三者让缓存复用变得更容易,子智能体的突发则让缓存模式变得难以预测。

四条特征合起来意味着什么

多轮、长上下文、高前缀复用,指向的是同一件事:KV缓存的存储量,正在变成推理成本的关键变量。缓存存得下,大量上下文就不用重算;存不下,前面省下的算力又得吐回去。

而子智能体的突发模式,则给这套缓存策略加了一道难题——突发意味着资源需求不是线性的,峰值和均值之间的差距会被拉大。

70%这个占比本身就说明,智能体已经不是推理流量里的边缘角色。当大多数推理请求都带着这四种特征进来,围绕单次请求设计的推理优化思路,覆盖不到的部分会越来越大。

四条特征里,前三条都在讲缓存能省多少,第四条在讲缓存有多难安排。这两股力量怎么平衡,决定了智能体推理的实际成本落在哪里。