AI写出来的东西,为什么总有一股"塑料味"?Meta RAM团队最近给出了一个答案:问题出在奖励信号上。

他们提出了一套叫RL-XAR的方法,核心思路是用少量专家文本自动优化评分细则,再拿这个细则当强化学习的奖励信号。实验结果显示,在论文补写和故事续写任务中,AI写作质量大幅提升,盲评胜率达到89%–95%。

写作是RL的洼地

数学和代码有客观对错,模型做对了就是做对了。但写作不一样,什么叫"写得好",很难用规则验证。

主流做法是找一个LLM当裁判,让它给文本打分。问题在于,这个裁判的品味上限,往往就是普通标注者的水平。结果就是:流畅但空洞的AI文本反而容易拿高分。

Meta团队把这种现象叫做"Slop同谋"——裁判和生成器合谋,一起生产低质内容。如果直接拿主流LLM当裁判做RLHF/RLAIF,训练出来的只会是"更受LLM裁判青睐的slop"。

用专家文本当锚点

RL-XAR的做法是引入一个元优化器,比如Kimi-K2.6,让它来构造评分标准。这个标准的目标很明确:最大化人类专家文本和AI文本之间的分差。

换句话说,评分标准要能有效区分"专家写的"和"AI写的"。判别器不需要人工标注偏好,只需要免费存在的专家文本作为锚点。然后把这个标准作为GRPO的奖励信号,去训练生成模型。

整个过程形成了一种"生成器-判别器"的对抗优化:生成器努力写得更像专家,判别器努力找出AI痕迹,两边互相拉扯,标准越来越精准。

奖励的是段落本位,不是表面润色

元优化后的评分标准有一个明显特征:它奖励的是"段落本位"和精准细节,而不是"微型全文摘要"式的面面俱到。

也就是说,好的标准能识别出克制的取舍——该展开的地方展开,该收住的地方收住。它不会因为文本流畅、覆盖面广就给高分,而是看有没有真正抓住专业写作的规律。

这恰好解释了为什么很多AI文本读起来"什么都说了,又好像什么都没说":它们迎合的是表面润色,而不是段落本身的推进逻辑。

RL-XAR的价值在于,它证明了写作类不可验证任务,也能找到有效的奖励信号。锚点不需要大规模人工标注,专家文本本身就够用。