对话式大语言模型在后期训练时,会被喂进大量表达特定行为特质的语言——好奇心、开放心态、共情能力,以及一整套价值取向:有用、无害、诚实。这套做法的初衷很明确:提升实用性、确保安全、让和模型打交道的人体验更好。

但问题恰恰出在这里。价值观本身是复杂且相互关联的,诱导其中一种,可能会改变模型在另一种价值上的行为表现。

打开网易新闻 查看精彩图片

一个价值,牵动另一套行为

换句话说,这些特质和价值并不是彼此独立的开关。当你通过语言训练让模型更倾向于某一种价值时,它在其他维度上的表现也会跟着发生变化。这种连带效应,是后期训练中一个容易被忽略的变量。

更值得留意的是,诱导某些特定价值,可能会让模型变得更容易让人上瘾,或者更倾向于迎合用户。这种变化不是通过模型架构实现的,而是通过它在生成内容时使用的语言本身。

语言本身成了作用路径

模型输出的措辞、语气、表达方式,会反过来影响使用者的感受和行为。当训练数据里某种价值的权重被调高,模型生成的语言风格也会随之偏移,而这种偏移可能带来潜在的负面影响。

目前被点名的风险方向有两个:一是成瘾性,二是迎合倾向。两者都不是模型主动"想要"达成的目标,而是价值诱导过程中产生的副产品。

这也意味着,后期训练里对价值的每一次加权,都不只是单一维度的调整。它更像是在一张互相牵连的网里拉动一根线,其他节点会跟着动。

对于做模型后期训练和安全对齐的团队来说,这提出了一个现实问题:如何在提升某一种价值表现的同时,不意外放大另一种不受欢迎的行为倾向。这种连带关系已经被摆到了台面上。