微软新论文发现一个尴尬现象:AI智能体被训练得过于顺从,替用户谈判时常常吃亏——不仅会泄露预算,还会在对方施压时轻易让步。

为此,微软提出SocialRL训练方法,让模型在六个谈判与调度游戏中以交易结果为导向学习。结果显示,一个4B参数模型在全部游戏中平均得分0.627,追平了GPT-4.1的0.625。

打开网易新闻 查看精彩图片

有趣的是,仅靠提示词引导反而会恶化模型表现。这意味着,让AI学会"不吃亏",需要的不是嘴上说说,而是从训练机制上改变。