你有没有想过这样一件事:两个AI模型能不能不说话,就把脑子里的东西传给对方?
这不是科幻场景。最近两年,研究者们一直在琢磨一个问题:与其让一个AI把答案写成文字,再让另一个AI去读这段文字,能不能直接把第一个AI"脑子里正在算的东西"原封不动地传过去?这种做法有个名字,叫潜在通信。
潜在通信:不通过文字,而是直接传递模型内部的数字状态(比如注意力机制里的键值向量)给另一个模型,跳过"生成文字再理解文字"这一步。
听起来很酷,对吧?跳过文字这个中间商,效率应该更高,信息损失应该更少。过去几年确实有不少论文用这个思路做出了漂亮的实验结果:接收方模型的准确率从三四十分蹦到七八十分,涨幅动辄十几个百分点。
但这篇来自香港城市大学等机构的论文,Draft-KV,提出了一个让人后背发凉的问题:这些涨分,真的是因为接收方读懂了发送方传来的内容吗?
还是说,这个"通信接口"本身自带了魔法,不管你传什么进去,它都能让接收方变聪明?
**如果一个系统在你换掉传递内容之后表现几乎不变,那它涨的分数就和你传了什么没有关系。**
这个念头一旦被验证,后果很严重。研究者们检验了五组"方法-数据集"组合,做法很简单:把原本要传给接收方模型的那条信息,换成一条完全不相关问题产生的信息。结果发现,换了之后,接收方的准确率最多只变化0.6个百分点。而与此同时,"有通信"和"没通信"之间的差距,最高能到15.44个百分点。
这就好比你请了个翻译,本以为他在认真翻译你说的话,结果发现不管你说什么,他都念同一段背好的台词,客户还听得挺满意。翻译这个角色,看起来有用,其实是摆设。如果不去做这个替换实验,你永远不会发现这一点,因为系统的整体表现看起来完美无缺。
论文把这个现象叫做信息使用鸿沟。研究者用一个简单的公式来拆解这件事:系统增益(有通信减去没通信的差距)和配对增益(正确配对消息减去错乱配对消息的差距)。如果配对增益接近零而系统增益很大,就说明这套系统的好处大概率不来自于"读懂了对方传来的内容",而是来自于接口本身带来的某种适配效应。
那问题来了:能不能设计一套通信机制,让配对增益也变得实实在在?
症结出在哪:接口在悄悄"背答案"
在深挖解决方案之前,得先搞清楚这个鸿沟是怎么产生的。
论文分析了两个具体的既有系统:C2C(Cache-to-Cache,一种把发送方的提示词缓存投影融合进接收方缓存的方法)和LatentMAS(一种通过共享键值缓存做多智能体协作的免训练方法)。
**缓存*:Transformer模型在处理文字时,会为每个词生成一对叫做"键"和"值"的数字向量,这些向量会被存下来重复使用,加速后续计算,这个存储的地方就叫缓存。**
研究者做了一个叫"仅适配器"的对照实验:把接口在多个错配消息下产生的输出取平均,看看这个被"平均掉了具体内容"的输出还能保留多少准确率。结果显示,C2C在三个基准测试上分别保留了96.06%、95.93%、93.16%的匹配准确率。换句话说,即便你把传入的具体内容打乱平均,接口依然能给出接近满分的表现。
这说明了什么?接口里存在一个只依赖接收方自身输入、和传入内容基本无关的组件,它自己就能撑起大部分的分数。
更让人意外的是关于"发送方越强,接收方是不是获益越多"这个问题的答案。论文测试了C2C在0.6B到8B参数规模的发送方模型上的表现,发现发送方自己单独作答的准确率涨了29.85个百分点,但整个系统的准确率只涨了3.54个百分点。用一个14B的发送方模型换掉8B的,独立作答准确率涨了4.48个百分点,系统准确率却只涨了0.77个百分点。
**发送方*:在双模型协作场景中,负责先处理问题、生成内部计算状态并传递出去的那个模型;接收方则是最终接收这些信息并给出答案的模型。**
这就像你雇了个特别厉害的顾问,但你给顾问配的传话渠道特别窄,顾问知道再多,传过来的还是那几句话。顾问从大学生水平升级成院士水平,你听到的建议却几乎没变化,因为瓶颈根本不在顾问脑子里,而在传话这根管道上。如果这根管道本身就是决定输出质量的主要因素,那你换多厉害的发送方模型都是在做无用功。
Draft-KV的解法:让发送方先"打个草稿"
搞清楚问题出在哪之后,Draft-KV团队给出了自己的方案,思路其实挺朴素:与其传递一个静态的"提示词编码",不如让发送方先真刀真枪地尝试回答一次问题,然后把它答题过程中产生的键值状态传出去。
这里有个关键的技术细节需要展开。在Transformer的因果注意力机制下,一个词的键值状态一旦生成就不会因为后面新增的词而改变。也就是说,如果只传"提示词位置"的键值状态,那传出去的东西其实只反映了发送方"读完问题"那一刻的状态,跟它后来是怎么想、怎么答的没有关系。
而如果传"草稿位置"的键值状态,也就是发送方一边生成答案草稿、一边产生的这些状态,它们不仅包含了问题本身,还包含了发送方在推理过程中留下的痕迹。
**草稿*:论文中指发送方模型在没有看到标准答案的情况下,针对当前问题贪婪解码生成的一次答题尝试,这个答案不一定正确,但生成过程中产生的键值状态携带了推理痕迹。**
这个设计选择的价值,在论文的消融实验里得到了狠狠的验证。研究者做了一个对照:把传输内容从草稿位置的键值状态换成提示词位置的键值状态,其他所有条件不变。结果在ARC-Challenge上,匹配准确率从83.53%暴跌到49.83%,配对增益从45.90个百分点几乎归零,只剩0.17个百分点。在MMLU-Redux上也是类似的崩塌,从65.07%掉到43.59%,配对增益从28.23降到0.09。
**这个数字变化清楚地告诉我们,草稿位置的状态才是配对增益真正的来源。**
打个比方,这就像考试的时候,老师让你把草稿纸也一起交上来,而不是只交一张题目卷。题目卷谁都一样,交上去改卷老师根本看不出你到底会不会做;草稿纸上写满了你的演算过程、划掉的错误思路、反复验算的痕迹,这才是真正暴露"你脑子里在想什么"的东西。如果只传提示词状态,相当于只交题目卷,接收方压根没法知道发送方是怎么想的,自然也谈不上真正的信息传递。
桥梁怎么搭:跨模型投影和门控读取
光有草稿状态还不够,因为发送方和接收方很可能是两个完全不同架构的模型。分词器不同、隐藏层维度不同、键值头数量也可能不同,这些数字状态没法直接套用。
Draft-KV设计了一套轻量级的桥接机制。核心思路是用两个不带偏置项的线性投影层,把发送方的键值张量转换到接收方能识别的维度和头部布局上。这两个投影层,加上每个键值头一个的门控参数(用tanh函数压缩到-1到1之间,初始值设为零),就是整个可训练部分的全部内容。
**门控*:一种可学习的缩放系数,用来控制外部传入信息对最终计算结果的影响程度,数值越接近零表示外部信息的影响越弱。**
这里有一个特别聪明的设计:接收方读取这些传入信息时,走的是一条单独的"侧路",而不是把这些状态直接塞进接收方自己的自注意力缓存里去混合。接收方复用自己原本冻结不动的查询投影、输出投影和归一化模块,用这些去"读"侧边记忆库里的内容,读到的结果经过门控缩放后,和原生自注意力的输出相加,一起送进残差流。
因为门控在初始化时是零,所以刚开始训练的时候,这条外部通道完全不起作用,模型的行为和没有通信时一模一样。这个设计很像给房子新装一扇门,但一开始这扇门是焊死的,等确认了门后面的东西值得进来,再慢慢把焊接点打开。
整个接口有多大呢?在最常见的配置下,比如用Qwen3系列模型做发送方、Qwen2.5-0.5B-Instruct做接收方,可训练参数只有1,048,584个,也就是刚好100万出头。相比之下,C2C的参数量是这个数字的348倍。
三阶段训练:先学会读信,再学会用信
光有结构不够,怎么训练也很关键。论文提出了一个渐进式训练方案,分三个阶段,一步步教会接口"怎么正确使用这条消息"。
第一阶段叫消息重建。这个阶段完全不涉及问答任务,做法是拿一段对话的最后一句助手回复当作要传输的"载荷",让发送方编码这段内容,接收方在完全看不到原始对话、问题的情况下,只凭一个固定指令,试图从传入的消息里一字不差地复原出这段载荷。
这一步的目的其实很纯粹:先确保接收方真的能读懂这条"信",而不是学会怎么用这条信去解题。
**如果跳过这一步会怎样?答案就藏在消融实验里。**
去掉重建预训练之后直接训练下游任务,在ARC-Challenge上匹配准确率从83.53%掉到76.71%,配对增益从45.90掉到38.74个百分点;在完全没训练过的MMLU-Redux上损失更明显,从65.07掉到52.40,配对增益从28.23骤降到16.58。这说明这个"先学认字"的阶段确实是有必要的,跳过它接口就像一个还没学会拼音就要求默写作文的学生,能凑合写出点东西,但漏洞百出。
第二阶段叫答案对齐。这时候传入的消息换成了发送方自己真实生成的草稿状态,目标是数据集里的标准答案。因为草稿本身可能是错的,标准答案也不会喂给发送方看,所以接收方要学的是"怎么从草稿状态里提炼出正确答案",而不是简单地照抄草稿的结论。每训练四步任务,就插入一步重建训练,防止接收方"忘记怎么读信"。
第三阶段是最有意思的地方,涉及一个叫"单侧护栏"的设计。
在这个阶段,研究者会同时构造三种情况给同一道题:正确配对的消息(Matched)、来自另一道题的错乱消息(Deranged)、完全没有消息(Receiver-only)。训练目标里有两项:第一项让接收方在拿到正确消息时尽量答对;第二项是护栏项,它只在"错乱消息比不传消息还要坑"的时候才启动,把这种伤害压下去。
**单侧护栏*:一种训练机制,只惩罚"接收到错误配对消息时表现比完全不通信还差"的情况,不会因为正确消息带来了额外收益而进行任何反向抑制。**
这个护栏为什么要设计成"单侧"的?因为研究者担心一种情况:如果强行要求正确消息和错误消息之间的差距越大越好,模型可能会学会一种取巧的策略,故意在收到错误消息时表现得特别差,制造出一个虚假的大差距,而不是真的提升了对正确消息的利用能力。单侧设计只堵住"变得更差"这一条路,不去人为放大差距,这样测出来的配对增益才是真实可信的。
论文用一个消融实验验证了护栏的效果:去掉护栏后,ARC-Challenge的错乱消息造成的伤害从2.47个百分点涨到4.18,平均护栏铰链值从0.038涨到0.091,超过阈值的比例从19.7%涨到37.9%。有护栏的时候,匹配准确率不但没有牺牲,反而比无护栏版本还高出0.59个百分点。
这就像给一个新员工培训,你既要教他遇到靠谱的客户要求要认真执行,又要提醒他遇到明显有问题的指令别照单全收酿成大祸,但不能矫枉过正到看见任何指令都先怀疑三分、畏手畏脚不敢干活。单侧护栏做的正是这个平衡:只防下限,不设上限。
实测数据:78.04%对37.45%对36.40%
说了这么多设计理念,最终要靠数字说话。
论文的核心实验用Qwen3-8B做发送方,Qwen2.5-0.5B-Instruct做接收方,在MMLU-Redux(一个综合知识测试基准)上,接收方单独作答只有37.45%,用Draft-KV通信后达到78.04%,而如果换成错乱配对的消息,只有36.40%,几乎和不通信一样。
**这组数字放在一起看特别有说服力:78.04%、37.45%、36.40%,前两个数字的差距证明了这套系统确实有用,后两个数字的接近证明了这套系统的用处真真切切来自于正确配对的内容,而不是接口本身的某种适配魔法。**
跨越35组"公开协议"测试(也就是发送方和接收方看到同一个问题的场景),Draft-KV在所有35个场景里都超过了只用接收方单独作答的基线,其中30个场景拿到了最高分,33个场景超过了把草稿直接以文字形式传给接收方的做法(论文里叫Text-to-Text)。平均涨幅是5.85分。
规模化实验也很说明问题。固定住接收方Qwen2.5-0.5B-Instruct,让发送方从0.6B涨到8B,Draft-KV的系统增益从9.63个百分点一路涨到42.25个百分点,几乎和发送方的能力涨幅成正比。反观C2C,同样规模跨度下系统增益只涨了1.4个百分点。这个对比直接呼应了前面提到的问题:一个好的通信接口,应该能让更强的发送方产生更大的价值,而不是把价值锁死在接口本身的天花板上。
论文还测了一个更有挑战性的场景,叫"私有协议":把HotpotQA和2WikiMultihopQA这两个需要多跳推理的问答数据集里的标注证据随机拆成两半,一半给发送方看,一半给接收方看,谁都看不到完整证据。这种设定下,Draft-KV在全部14个模型-基准组合里都超过了纯文字传递方案,平均高出6.41分,其中7个场景排名第一,且这7个场景里系统表现同时超过了两个模型各自单独作答的水平。这说明当两个模型各自握有不同的信息碎片时,这套通信机制真的能把碎片拼成完整答案。
论文附录里给了几个具体的例子特别生动。比如有一道题问"某说唱歌手的首张专辑全球销量超过多少",发送方那半证据只说了"这张专辑是该歌手的首张专辑",接收方那半证据说"这位歌手总共卖出超过200万张唱片"。发送方单独回答会瞎编成2000万,接收方单独回答会因为不知道问的是首张专辑而猜成20万,只有两边信息通过正确配对的消息拼在一起,答案才精确落在200万这个正确数字上。
代价与局限:不是没有失手的时候
任何方法都不是万能的,Draft-KV也有它接不住的场景。
论文专门做了一个"丢失案例"分析,找出发送方答对了但Draft-KV答错了的情况。一个典型例子是问"早上41华氏度,晴朗温和的一天,下午两点大概是多少度",草稿里发送方先算出应该在51到61华氏度之间,然后莫名其妙又选了78华氏度这个选项,逻辑前后矛盾。这种情况下,传出去的消息似乎携带了发送方那种"犹豫不决"的状态,而不是它最终写下的结论,接收方因此没有被带偏,但也没能借着这条消息答对题目,还是守着自己原来错误的先验答案。
另一个例子涉及一个需要两步链式推理的数学题:已知f(2)=f??(2)=4,求f(f(2))。发送方能正确推导出答案是2,但这种需要逐步验证的推理链条,通过键值状态压缩传递的效果不如直接读一段完整的文字推导。这也提示了一个边界:**Draft-KV擅长传递"答案是什么",但不擅长传递"为什么是这个答案"这种需要逐步核验的推理过程。**
这在论文的统计里也有体现,ARC-Challenge上大约1%的发送方原本答对的题目,在Draft-KV接手后变成了错的;MMLU-Redux上这个比例大约是3%左右。相比之下,Draft-KV挽回的发送方本来答错的题目比例要高得多,ARC-Challenge上是24.1%,MMLU-Redux上是13.8%。这是一笔划算的买卖,但不是零风险的买卖。
论文另外做了个对照实验,把同一份草稿分别以文字形式(Text-to-Text)和键值状态形式传给接收方。结果发现两种方式纠正错误的能力差不多,但文字形式覆盖掉接收方原本正确答案的概率要高得多,在ARC-Challenge上文字方式的"误伤率"是7.41%,Draft-KV只有1.07%,相差接近7倍。这背后的原因值得琢磨:文字传递的是发送方最终写下的那句可能错误的结论,接收方读到这句话往往会不假思索地采纳;而键值状态传递的更像是一种"参考意见",接收方在自己已经确信的情况下,不太容易被这种意见轻易带偏。
写在后面
读完这篇论文,最触动我的其实不是Draft-KV本身设计得多巧妙,而是它提出的那个检验方法:把传入的消息换成别的消息,看看结果变不变。
这个思路简单到近乎朴素,但它揭穿的问题却相当尖锐。它说明了一件事:一个系统在整体指标上表现出色,不代表它内部真的在做你以为它在做的事情。这种"表面有效、内里空心"的现象,恐怕不只出现在潜在通信这一个细分领域里。任何涉及"两个模块协作"的系统设计,都值得问一句:如果我换掉其中一个模块传给另一个模块的内容,结果会不会变?如果答案是几乎不变,那这两个模块之间的"协作"很可能只是一个好看的说法。
还有一个细节让我印象很深,论文附录里那个"错乱案例"表格显示,当接收方拿到别的问题的消息时,它给出的错误答案经常恰好就是那道"别的问题"的正确答案。这说明接口确实在忠实地传递内容,只是传递的内容配错了对象。这从侧面证明了这套机制的信息传递能力是真实的,问题只出在"传什么"和"传给谁"要严格对应上。
论文里还提到一个耐人寻味的现象:接收方在拿到令自己困惑或者跟自己已有认知冲突的信息时,有时候会守住自己原本的答案,宁可信心值降低也不改变判断。这种"半信半疑但不轻易改口"的行为模式,某种程度上比全盘接受更让人放心,也更值得后续研究者深挖:这种保守倾向,到底是训练出来的一种谨慎,还是接口结构本身带来的某种阻尼效应?
Q&A
Q1:Draft-KV是什么?
A:Draft-KV是一种让两个语言模型直接交换内部计算状态的通信方法,核心做法是让发送方先针对问题打一份答案草稿,然后把草稿生成过程中产生的键值状态传给接收方,接收方通过一个轻量级门控接口读取这些状态来辅助作答。
Q2:为什么说很多现有的模型间潜在通信方法可能是"假有效"?
A:论文发现,把传给接收方的正确消息换成一条无关问题产生的消息后,接收方准确率几乎不变,最多只变化0.6个百分点,但通信整体带来的涨幅却高达15.44个百分点,说明涨分很可能来自接口结构本身而非传递的具体内容。
Q3:Draft-KV的效果具体有多好?
A:在MMLU-Redux测试中,用Qwen3-8B做发送方、Qwen2.5-0.5B-Instruct做接收方,单独作答只有37.45%,用Draft-KV通信后达到78.04%,而换成错乱配对消息只有36.40%,证明涨分确实来自正确传递的内容。
热门跟贴