控制大模型的输出,是它可靠部署的核心难题,但其中涉及的权衡关系,目前仍缺乏清晰理解。现有条件控制方法在评估时,常常只盯着注入或移除目标概念的有效性,而忽略了生成质量。一项系统性研究同时考察了注入和移除两种场景下的多种条件控制方法,得出的结论是:高效的引导方法往往能实现条件控制,代价却是流畅度的陡峭损失。

与训练范式的交互作用

打开网易新闻 查看精彩图片

研究指出一个关键且此前被忽视的交互作用:激活引导(activation steering)方法在指令微调模型上的效果,远不如在基础模型上。

另一方面,简单提示(prompting)和完整的监督微调,是概念注入的可行选项,但在概念移除上表现没那么好。

注入和移除,结论并不对称

研究把条件控制拆成注入和移除两个方向来看:

  • 简单提示和完整的监督微调,是概念注入的可行选项;
  • 但这两者在概念移除上表现不佳;
  • 高效的引导方法能实现条件控制,代价是流畅度损失陡峭。

便宜的指标,能替代昂贵的评判

研究还给出一个实用结论:低成本计算出的文本指标,与昂贵的“大模型当裁判”(LLM-as-judge)评分高度相关,并能为了解条件控制方法的行为提供洞察。

整项研究的落点很明确:控制大模型输出是可靠部署的核心难题,而当前对其中权衡关系的理解仍然模糊。只关注有效性,会漏掉流畅度这一侧的账。