大模型做跨国调查问卷,模拟出来的"受访者"靠谱吗?清华等高校最新研究给出了一个值得警惕的答案:模型对澳大利亚、北美、欧洲的模拟更准确,而对其他地区的模拟精度明显偏低。

系统性偏差,不是偶然

打开网易新闻 查看精彩图片

这项研究提出了一个名为"表征平等"的评估框架,专门用来检验大语言模型作为合成受访者时,模拟精度是否在不同群体间均衡分布。测试规模不小:覆盖59个国家、2420个亚组,并动用了9个开源模型

打开网易新闻 查看精彩图片

结果发现,这种模拟不平等是系统性的,并非个别模型的偶发问题。模型在模拟高收入国家人群时表现更好,而在模拟其他国家时则存在明显落差。

精度与GDP挂钩,暴露数据短板

更值得关注的是数据背后的关联:国家模拟精度与人均GDP、互联网普及率呈正相关。也就是说,经济越发达、网络越普及的地区,模型模拟得越准。

打开网易新闻 查看精彩图片

这背后指向一个老问题——训练数据的分布不均。富裕国家在互联网上的内容产出更多,模型学到的样本自然更充分;而欠发达地区的数据相对稀缺,模拟精度自然打折。

这项研究提醒我们,如果要用大模型替代真实受访者做跨国调查,"偏科"问题必须正视。否则,调查结果可能会在不知不觉中偏向某些地区的声音。