同样一段信息,放在上下文的前半段能准确检索出来,挪到后半段却怎么都找不到——这不是模型"抽风",而是一种有规律可循的系统性偏差。
字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈的正是分块 KV 缓存压缩带来的相位敏感性,直指 DeepSeek"抽风"的原因。
打开网易新闻 查看精彩图片
压缩省了成本,也带来了新坐标
模型通过分块 KV 缓存压缩,以固定步幅把连续标记的窗口压缩成更少的缓存条目,目的是减少长上下文推理的内存和注意力成本。
但压缩同时引入了一个新的位置坐标:Token 的相位,也就是它相对于压缩窗口边界的位置。位置变了,检索表现也跟着变。
同一信息,两个相位两种命运
团队发现,使用这种压缩的模型存在系统性不对称性:相同的信息在一个阶段很容易检索,在另一个阶段却很难检索。他们把这种检索性能的周期性变化称为相位敏感性(phase sensitivity)。
在采用此类压缩的大型开放权重模型中,长上下文检索准确度在各个阶段之间可能相差高达 40 个百分点。这意味着平均基准分数看起来很稳,却可能掩盖了这种周期性弱点。
研究评估的对象包括基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。
换句话说,一个模型在榜单上的平均分,未必代表它在每个位置都同样可靠。
热门跟贴