打开网易新闻 查看精彩图片

这项由蚂蚁集团(Ant Group)研究人员主导完成的研究,于2026年7月以预印本形式发布在arXiv平台,论文编号为arXiv:2607.07050v2,归属于计算机科学·计算与语言(cs.CL)方向。感兴趣的读者可通过该编号检索完整论文。

**研究概要:当AI助手变得"工具成瘾"**

你有没有遇到过这样的情况:明明一个简单问题直接回答就好,但身边有个朋友非要先翻手机查资料、再查一遍、然后再查一遍,最后才给你一个你等了半天的答案?这个场景,正在当下最先进的AI对话助手身上真实上演。

现代AI助手越来越像一个全能管家,它可以直接回答你的问题,也可以调用外部工具——比如查天气、查股价、执行代码——来获取信息再回答你。这种"要不要用工具"的决策能力,对于AI助手的实用性至关重要。用得太少,AI错过了本该用工具才能完成的任务;用得太多,AI就变成了那个凡事都要先查手机的朋友,不仅慢,而且烦,有时候还会陷入反复调用工具的死循环。

蚂蚁集团的研究团队发现,当前一种流行的AI训练方式——让两个"专家老师"同时教一个"学生AI"——会悄悄地让这个学生AI染上"工具成瘾症"。更麻烦的是,通常用来评估训练效果的指标完全没有报警,一切看起来都很正常,而问题早已埋下。这项研究不仅准确诊断了这个问题的来源,还提出了多种应对策略,并系统地比较了它们各自的优缺点。

**一、两个老师教一个学生,问题出在哪里**

要理解这个问题,先得明白AI是怎么被训练的。

当下训练AI对话助手有一种很流行的做法,叫做"在线策略蒸馏"(on-policy distillation,简称OPD)。可以把它理解成这样一个学习场景:学生AI先自己尝试写一段对话,然后老师AI过来点评,告诉学生"你这个词选错了,应该用这个",学生根据点评调整自己。这种方式的好处是学生总是在针对自己真实会犯的错误进行练习,而不是死背标准答案。

现在,如果我们希望学生AI既能熟练调用工具,又能流畅地直接回答问题,一个自然的想法是:找两个专家老师。一个老师专门擅长调用工具(工具调用老师),一个老师专门擅长直接回答(直接回答老师)。遇到需要调用工具的例子,就让工具老师来点评;遇到应该直接回答的例子,就让回答老师来点评。这套方案听起来相当合理。

蚂蚁集团的研究团队用一个叫做APIGen-MT的数据集做了实验——这个数据集包含了大量模拟真实场景的多轮对话,既有需要调用工具的对话,也有应该直接回答的对话。他们发现,按照上述"双老师蒸馏"的标准方案训练出来的学生AI,在"应该调用工具时能否正确调用"这个指标上确实进步显著,准确率从75.5%提升到了91.5%。

然而问题也同时出现了:在那些本来应该直接回答、根本不需要调用工具的对话里,学生AI开始莫名其妙地尝试调用工具。这个"乱调用工具"的比率,从基础模型的7.2%急剧攀升到了14.2%。换句话说,学生AI确实变得更擅长使用工具了,但同时也变得更难以克制地想要使用工具,即使场合根本不需要。

**二、表面平静之下的诊断:问题出在"位置",而非"数量"**

研究团队面临的第一个谜题是:这个问题是怎么产生的?最直觉的解释无非是:工具调用老师的影响力"压倒"了回答老师,导致学生偏向工具调用。但怎么验证或者否定这个猜测呢?

团队翻出了详细的训练日志,从三个角度检验这个"简单解释":训练过程中工具调用样本占用了多少学习机会、工具调用老师产生的"纠错信号"是否更大、以及某个叫做"詹森-香农散度"(JSD)的指标在两类样本上的差异。

詹森-香农散度可以理解成"老师和学生的意见分歧程度"——分歧越大,学生需要学习和修正的内容就越多,老师对学生的影响力就越强。

结果令人意外:在监测的训练过程中,回答类样本占据了更多的学习机会,回答老师的"意见分歧"也更大,而不是工具调用老师主导一切。换句话说,从"总量"的角度看,工具调用老师并没有占多数,甚至还处于劣势。那为什么学生AI还是偏向了工具调用?

研究团队提出了一个更精妙的解释,他们称之为"行为杠杆失衡"(behavior leverage imbalance)。这个概念的核心是:训练信号的重要性,不仅仅取决于它有多大,更取决于它落在了哪个位置。

打个比方:假设你在厨房里做一道复杂的菜。这道菜的整个流程有很多步骤,但最关键的一步是在最开始加盐的时机——加早了还是加晚了,决定了整道菜的走向,后面所有步骤的努力都建立在这一步的基础上。相比之下,后面"放多少胡椒粉"这类决策,影响范围就小得多。

在AI生成对话的过程中,``这个特殊标记就是那个"加盐时机"。一旦AI决定输出这个标记,整个对话就走上了"调用工具"的轨道,后续的函数名称、参数格式都顺着这条轨道走下去。工具调用老师的纠错信号,恰好高度集中在这些"路口"位置;而回答老师的信号则分散在后续大量的普通文字内容里。即使工具调用老师的总信号量更小,但它精准地撬动了最关键的那个决策点。

**三、用数据证实"信号位置"假说:极端值的集中与扩散**

为了把这个"信号位置"的假说从猜测变成诊断证据,研究团队做了一个精细的分析:把每一个训练样本中所有位置的"师生分歧程度"从大到小排列,然后看最大的1%、5%、10%的位置,合计贡献了多少分歧量。

结果非常清晰。在标准训练方式下,仅仅最大的1%的位置,就贡献了全部分歧量的41.2%;最大的5%,贡献了76.8%。这意味着信号极度集中——少数几个关键位置承载着绝大部分的"教学压力",而这些高压位置,恰好就是那些控制着对话走向的结构性标记。

进一步的证据来自训练过程的实时监测。研究团队专门统计了一个指标:在那些"应该直接回答"的训练样本里,学生AI在第一个预测位置给``这个标记赋予的概率有多大?他们发现,随着训练进行,这个概率在标准方案下稳步攀升,而且这个概率的变化,与最终测试中"乱调用工具"的比率高度一致。这个关联证实了:问题的根源就在于那个关键的"进入工具调用模式"的决策节点。

为了进一步排除"只是最开头几个字符搞的鬼"这个简单解释,研究团队还做了一个对照实验:只对每个训练样本最前面4个字符位置的信号进行压缩,其他位置保持不变。结果发现,这种"只压缩前4个字符"的方案,几乎没有改善乱调用工具的问题(比率从13.65%仅降到13.75%)。这说明高杠杆位置并不只是最开头那几个字符,而是分散在整个对话结构的多个关键节点上,比如工具调用块结束之后、结构性标记附近,以及其他师生意见高度不一致的位置。

**四、四种应对方案:各有招式,各有取舍**

确认了问题的本质之后,研究团队提出并系统比较了四种不同的应对策略。可以把这四种策略想象成四种不同风格的"教学纪律管理方式"。

第一种叫"硬截断"(Hard Clip)。它的做法非常直接:给每个位置的"师生分歧程度"设一个固定上限,超过这个上限的一律截断到上限值,超出部分的纠错信号直接丢弃。这就像老师批改作业时规定"每道题最多扣10分,超过的部分不计"。好处是实现简单,问题是那些被截断的高分歧位置,它们的纠错信号就这么消失了,学生在那些最难的位置反而学不到东西。

第二种叫"全局重加权"(Global Reweight)。它不是直接截断,而是根据每个批次里所有位置的分歧大小,重新计算每个位置的"权重"——分歧大的位置权重降低,分歧小的位置权重提高。这就像老师按照相对成绩曲线来给分:总有人得满分,总有人得低分,中间段的人按比例分布。这种方式比硬截断更温和,不会完全丢弃任何信号,但它改变了所有位置的权重,包括那些本来分歧适中的普通位置。

第三种是研究团队重点推出的新方案,叫"软截断"(Soft Clamp)。它的设计理念是:只动极端值,不动普通值。具体来说,它先计算当前这批训练样本中所有位置分歧的平均值,然后乘以一个倍数(比如3倍),得到一个动态阈值。低于这个阈值的位置,完全不做任何干预;高于阈值的位置,把它们的"前向贡献"压缩到阈值水平,但保留一个按比例缩小的梯度信号,确保学生在那些最难的位置仍然能得到纠正,只是力度被控制了。

这个方案的精妙之处在于"有所为有所不为":大多数普通位置完全不受影响,学习效率没有损失;只有那些极端高分歧位置的影响力被压缩,避免它们"一手遮天"。而且动态阈值会随着训练进展自动调整,不需要人工在不同训练阶段手动设置参数。

第四种方案不是训练时的干预,而是部署时的临时补救,叫"推理时入口偏置"(inference-time entry bias)。做法是:在模型训练完成后,在测试或部署时,人工给``这个标记的预测概率施加一个负向偏移,让模型在进入工具调用模式时"多想一下",提高门槛。这需要针对每个训练好的模型单独在验证集上调试偏移量,然后冻结使用。

**五、实验数字说话:软截断的实际效果**

研究团队在Qwen3.5-9B这个大语言模型上,用三个不同的随机种子重复实验,以减少偶然性,并报告了均值和标准差。

在最核心的"乱调用工具"比率上,标准方案的平均值是14.2%,标准差是2.1个百分点(意味着三次实验结果之间有相当的波动)。硬截断把这个比率降低到11.9%,但标准差也降到了0.9。全局重加权降到了9.7%,标准差0.8。软截断则降到了9.0%,标准差只有0.2——这个0.2意味着三次实验结果非常稳定,几乎每次都是这个结果,可重复性最强。

代价是什么?软截断把"应该调用工具时的正确率"(工具调用召回率)从标准方案的91.5%降到了86.5%。换句话说,软截断牺牲了一部分"见到工具任务就果断出手"的能力,来换取"不该出手时能忍住"的稳定性。这个权衡是否值得,取决于具体的应用场景——如果漏掉一个工具调用任务的代价高,那就要谨慎;如果被AI反复无意义调用工具的代价高(比如增加延迟、增加费用、陷入死循环),那软截断就很划算。

多轮对话的压力测试更能体现这个问题的实际影响。研究团队构建了一个测试场景:800个真实函数调用任务,让模型和一个模拟的"工具环境"连续交互,最多可以进行5轮工具调用。标准训练方案下,模型平均每轮用户请求会触发1.515次工具调用,其中15.1%的轮次会出现连续3次或以上调用(即陷入循环),17.7%的轮次里模型会反复调用同一个函数(死循环的典型症状)。软截断把这些数字分别压缩到1.289次、10.3%和11.3%,最终能给出一个非工具调用答案(正常结束对话)的比率也从87.3%提升到93.9%。全局重加权在这个测试里的表现和软截断很接近,属于势均力敌的强竞争对手。

研究团队还用一个比较小的模型(Qwen3.5-4B)重复了整个实验,使用了相同的大模型教师对、相同的数据和相同的训练配方,只是换了个更小的"学生"。结果显示,同样的"工具成瘾"问题在4B模型上同样出现(标准方案下乱调用比率12.8%),软截断和全局重加权都能把它压缩到大约9%左右。这说明这个问题不是某个特定模型大小的特有问题,在不同规模的模型上都可能出现。

**六、推理时偏置能替代训练时修复吗**

关于那个第四种方案——推理时给``加一个负向偏移——研究团队做了一个细致的对比分析,试图弄清楚它是否能作为训练时软截断的替代品。

他们的做法是:在验证集上扫描不同的偏移强度,找到一个让模型表现和软截断在第一个字符位置最接近的偏移量,然后把这个偏移量固定用于测试集。结果显示,在"响应样本里第一个字符就把工具调用标记排第一"这个狭义指标上,经过精心调参的推理偏置确实能接近软截断的效果(11.2%对11.1%)。

但是,这种近似是有代价的。经过推理偏置调整的标准方案,工具调用召回率降到了89.2%,而软截断能保持90.4%;第一字符位置的决策准确率也从软截断的89.7%降到了89.0%;三次实验间的波动也更大。在多轮对话压力测试里,推理偏置在压缩调用频率和循环率上基本能追上软截断,但在"最终给出非工具答案的比率"和"无效调用比率"上,软截断仍然保持了更好的表现。

由此可见,推理时入口偏置能解决一部分问题——主要是压制那个最关键的第一个词的选择——但它没有解决整个训练过程中在多个关键位置积累起来的边界偏移。软截断在训练阶段就从根源上修正了这些偏移,效果更全面。不过推理偏置有其独特的优势:不需要重新训练,可以快速部署,是一种紧急修复手段。

**七、训练过程本身也是证据**

为了确认问题是训练过程中持续存在的,而不是最后几步突然出现的,研究团队还保存了训练过程中的多个中间检查点,在每个检查点上都跑一遍测试。

结果显示,从训练开始的早期阶段,标准方案和软截断之间的差距就逐渐建立起来了,并且在训练的第150步之后保持稳定。在第150到319步的全部评估时间点上,标准方案的平均乱调用比率都高于软截断,到训练结束时差距稳定在14.2%对9.0%。这说明这不是某个偶然的训练波动,而是一个系统性的、持续的偏移。

早期训练阶段有一些"早期剧烈波动"的现象——某些随机种子下,模型的乱调用比率在训练初期会急剧飙升,然后逐渐回落稳定。这种早期波动的时机和幅度在不同随机种子之间存在差异,说明它是真实的模型行为波动,而不是评估工具的误判。但它的时机不固定,因此不适合作为主要分析对象。

**八、在其他测试集上的表现:不是万能药,也没有副作用**

研究团队还在另外两个独立数据集上测试了这些方法,以检验效果是否能迁移到训练数据之外的场景。

一个是BFCL(Berkeley Function Calling Leaderboard)数据集,专门测试AI调用函数的准确性,以及在不应该调用工具时能否克制。软截断在整体得分上是所有GKD变体里最高的(80.8%),但在"不该调用时能否拒绝"这个子项上,全局重加权(83.5%)和硬截断(83.2%)的平均值更高一点。这意味着没有哪个方案在所有子项上都是最优的。值得注意的是,所有这些方案都没能超过最基础的监督微调(Base SFT)的BFCL总分,说明双老师蒸馏方案虽然改善了工具使用决策,但在某些函数调用质量的指标上并没有带来额外收益,甚至有所损失。

另一个是When2Call数据集,它考察的是AI在更细粒度的情境判断:面对一个问题,是直接回答、还是需要先用工具、或者还需要用户提供更多信息、或者根本无法回答?这个测试的结果更加严峻——所有双老师蒸馏方案在"需要用户提供更多信息"和"无法回答"这两类情境上的表现,都明显差于基础模型和监督微调基线。这说明软截断等方法只是在"是否调用工具"这个二元决策层面进行了边界校正,但并没有让AI获得更广泛的情境判断能力。

这两个测试集上的结果共同表明:软截断是一个解决特定训练诱导问题的校正工具,而不是一个能全面提升AI工具使用能力的通用方案。它帮助AI从"双老师蒸馏导致的偏差状态"回归到一个更平衡的状态,但它不会让AI变成一个在任意工具使用判断任务上都更出色的系统。

**九、一个极端失败案例:没有格式约束会怎样**

研究团队还额外测试了一个"纯粹依靠老师对"的训练方案,完全去掉所有的监督格式约束,让学生AI完全从两个老师的分歧信号中学习。

结果极为糟糕:这个配置下训练出来的AI,在测试中有高达99.9%的概率都会选择进入工具调用模式——无论问题是否需要工具。更糟糕的是,它输出的工具调用格式千奇百怪,不符合任何规范,BFCL测试里有效函数调用的比率几乎是0%。在多轮对话测试里,100%的工具调用尝试都被判定为无效格式,模型完全无法完成任何任务。

这个极端案例有力地说明了:结构化工具调用有两个分离的失败模式——一是决策错误(该用工具时不用、不该用时乱用),二是格式错误(决策正确了但输出的结构不对,工具根本没法执行)。研究团队在主要实验中加入了一个小比例的监督格式约束(权重0.3),正是为了解决格式稳定性问题,让四种方案的比较能聚焦在"决策校正"这个核心问题上,排除格式问题的干扰。

归根结底,这项研究揭示了AI训练中一个容易被忽视的隐患:当你用两个专家同时训练一个AI时,这两个专家的信号并不只是按照数量大小来竞争,它们影响AI行为的方式取决于信号落在哪里。一个小小的"是否调用工具"的决策点,就像一个交叉路口的路标,一旦被调歪了,后面所有的路都走偏了。

这对于开发AI助手的工程师们来说是一个实用的提醒:光看训练损失曲线是不够的,必须专门监测那些行为边界位置的决策分布。软截断提供了一种简单、稳定、不需要额外数据的修正方案,但没有哪种方案能包打天下——在工具调用召回率、乱调用抑制、多轮稳定性和部署灵活性之间,永远存在权衡,需要根据具体应用场景来选择。

对于普通用户来说,这意味着未来与AI助手的交互可能会变得更加顺畅——一个经过边界校正的AI,不会动不动就去"查一下"那些明明可以直接回答的问题,也不会陷入反复调用工具的死循环,让你在等待中消磨耐心。感兴趣的读者可以通过arXiv编号2607.07050查阅完整论文,深入了解实验细节和所有数据。

Q&A

Q1:什么是"工具成瘾"问题,多教师知识蒸馏为什么会导致AI过度调用工具?

A:多教师知识蒸馏中,工具调用老师的训练信号高度集中在几个关键位置(比如``标记),而这些位置一旦被激活就决定了整个对话走向。即使工具老师提供的总信号量并不比回答老师多,这种"精准打击关键节点"的效果,也会让AI在不需要工具的场景里也倾向于进入工具调用模式,乱调用比率可以从7.2%飙升到14.2%。

Q2:软截断(Soft Clamp)和硬截断(Hard Clip)有什么区别,为什么软截断效果更好?

A:硬截断直接把超过阈值的信号截掉,那些最难的位置的学习信号就此消失,AI在关键位置反而学不到修正。软截断则保留了一个按比例缩小的梯度,AI在极端位置仍然能得到纠正,只是力度被控制住了。实验中软截断把乱调用比率降到9.0%且标准差仅0.2,重复性远优于硬截断的11.9%。

Q3:推理时加入入口偏置能否代替软截断来修复AI过度调用工具的问题?

A:推理时偏置能快速修复第一个词的选择偏差,可以作为部署后的应急手段,但它无法完全替代软截断。软截断在训练阶段系统性地修正了多个关键位置的边界偏移,在工具调用召回率、多轮对话结束率和无效调用比率上都保持了更好的综合表现,而推理时偏置在这些指标上均有残余差距,且需要针对每个模型单独调参。