你向AI助手吐槽同事抢了你的功劳,助手顺着你的话安慰你。但它听到的,只是你这一面的版本。对方当时怎么想的,助手无从得知。

这类社交咨询每天都在发生,评估却极难。其他人的真实意图没有标准答案,模型答得对不对,没法直接打分。Google Research 的新工作 Fuse 想解决的就是这件事:用模拟造出一份可以对照的"底稿"。

打开网易新闻 查看精彩图片

用模拟造出"标准答案"

Fuse 的做法是搭一个多智能体场景。一个带有隐藏动机的目标智能体,与其他智能体互动,其中一个是扮演用户的智能体。互动结束后,用户智能体向助手描述发生了什么,助手要做的,是推断出那个隐藏动机。

这样一来,动机是预先设定的,助手推断得准不准就有了参照。研究团队用 2.4万条人工标注验证了这些模拟的可靠性,并测试了 12个LLM

他们同时放出了框架和 2.1万个示例

只听到一面之词,任务会变难

测试里有一个关键变量:信息是直接给助手,还是经过用户转述。结果显示,通过用户转述事件,任务难度明显上升。

用户带有偏向性的叙述会改变助手的答案。也就是说,助手不只是在推理事实,还在被用户的措辞牵着走。

另一个发现是,模型有时比人类需要更多细节。而更长的对话、留出追问空间,并没有稳定地帮上忙。

我的判断

这项工作的价值,可能不在于给出"哪个模型社交推理更强"的排名,而在于它把一个模糊问题拆成了可操作的环节:设定动机、生成互动、转述事件、推断动机。

其中"通过用户转述"这一环尤其值得注意。它对应的是助手产品每天都在面对的现实——用户带着自己的立场来提问,助手如果照单全收,给出的建议就会偏向一方。Fuse 把这个偏差变成了可测量的对象,而不是停留在直觉层面。

至于更长的对话没能稳定提升表现,这一点对产品设计也有参考意义。追问更多细节不一定能修正判断。

框架和2.1万个示例已经放出,后续会有更多模型在这套设定下被比较。社交推理这件事,至少现在有了一个可以反复测量的起点。