来源:市场资讯
(来源:科技行者)
你可能没想过这样一个问题:如果一群AI机器人在一个模拟的社交平台上互相发帖、互相点赞、互相争论,它们的行为会不会像人类一样,被"点赞排行榜"悄悄改变?
更有意思的是另一个问题:如果有人想操纵这些AI机器人的立场,是雇一个"水军账号"拼命发帖更有效,还是雇四个账号分散发帖更有效?直觉上你可能觉得,账号越多,声势越大,说服力肯定越强。但这篇来自两位独立研究者的论文,用严谨的实验狠狠打了这个直觉的脸。
先说结论,这篇论文发现,让一群AI机器人互相围观彼此的帖子、并按点赞数排序展示,确实会让它们说话的方式变得越来越像。但如果你想靠"多开小号"来影响这些AI机器人的立场,实验数据告诉你:这招不一定管用,甚至在某些模型上完全不管用。
这不是一句空话,背后是整整448场严格控制的实验,横跨四种AI模型家族、四个话题、四个随机种子。研究者把这套实验系统起了个名字,叫PV-SST。
> PV-SST:全称Peer-Voted Social Simulation Testbed,中文可以理解为"同伴投票式社交模拟测试台",是本论文自建的一套实验环境,专门用来观察AI机器人在社交平台式互动中的群体行为。
为什么要造这么一个测试台?
现在的AI评测,大多是"单兵作战"式的。你给AI一道数学题,看它答得对不对;你给它一段代码,看它写得好不好。这些测试的共同点是,AI是孤立的,一个一个来,互不干扰。
但现实世界里,AI早就不是孤立作战了。它们被用作客服、被用作虚拟用户去测试产品、被用来在社交平台上自动生成内容。当一堆AI同时存在于一个环境里,一个AI发的帖子会被另一个AI看到、被点赞或者被踩,而这个反馈又会反过来影响下一轮的发帖内容。这是一个环环相扣的循环,用论文里的话说,这是"递归"的。
单独测一个AI能不能答对题,回答不了这个问题:当一大群AI互相围观、互相打分的时候,群体层面会冒出什么新行为?这就好比你单独测试一百个人的驾驶技术都合格,但你没法从这一百份单独的驾照考试成绩里,推断出这一百个人同时上路会不会堵车、会不会互相别车。堵车是一个群体现象,单人测试根本捕捉不到。如果不造这么一个能观察群体互动的测试台,我们就只能等真实的AI社交平台出问题之后再去救火,而不是提前发现风险。
这就是研究者要造PV-SST的原因,他们想在AI真正大规模涌入社交平台之前,先在一个可控的、完全能被审查的沙盒里,把可能出问题的机制一个一个找出来。
测试台是怎么运作的?
PV-SST的核心设定并不复杂。每一场实验里,会有12个"诚实智能体",也就是没有被操纵的AI角色,它们各自带着预设的人设,从24个候选人设里抽取。这些智能体的初始立场被精心平衡过,六种立场,从"强烈支持"到"强烈反对",每种立场的初始置信度都设定为0.70,做到绝对公平的起点。
整场实验跑六轮。每一轮里,每个智能体先接收一段"条件反馈",可能只是话题本身,也可能是同伴发的帖子,或者还夹杂着"敌对"内容。接着它要生成一条不超过180字符的帖子,同时更新自己的立场和置信度。然后,每个诚实智能体还要给最多五条别人的帖子投票,可以选择"喜欢""忽略"或者"踩"。这些票数会决定下一轮谁的帖子排在前面被更多人看到。
> 诚实智能体:指没有被人为设计成"带节奏"的正常AI角色,用来对照观察被操纵内容影响的对象。
这套流程听起来是不是很像你每天刷的社交软件?发帖、点赞、排序、再发帖,一个闭环。区别在于,这里的用户全是AI,而且每一步操作,包括谁给谁投了票、谁看到了什么内容,全部被完整记录下来,方便事后逐条审查。
这里有个细节特别值得说一下:研究者为了保证实验能重复验证,把生成内容用的随机种子固定死了,是"trial种子、轮次、阶段、智能体编号"的确定性函数。这意味着同样的设置跑两遍,理论上能得到完全一样的结果,这在AI研究里是相当难得的严谨程度。
核心实验一:同伴反馈会不会让AI说话都变得一个味?
第一个实验设计得很直接。研究者对比两种情况:一种是"只给话题,不给任何同伴的帖子",叫做对照组;另一种是"看到五条按点赞数排好序的同伴帖子",叫做实验组。
> TF-IDF余弦相似度:一种衡量文本相似程度的技术指标,数值越高说明两段文字用词、结构越相近。这里用来衡量12个智能体最后一轮发的帖子,彼此有多像。
结果是,在四种核心模型家族里,实验组比对照组的帖子相似度平均高出0.0082个TF-IDF余弦单位,95%的置信区间是[0.0043, 0.0121],随机化检验的p值只有0.000105,这个数字小到几乎可以排除"纯属巧合"的可能性。而在三个规模更大的模型变体里,这个差距还扩大到了0.0109,置信区间[0.0069, 0.0151],p值更是低至0.000001。
这组数字意味着什么?意味着两个独立跑出来的实验,用完全不同的模型规模,都得出了同一个方向的结论:只要能看到同伴按点赞排序的帖子,AI群体说话就会越来越像。而且这个效应不是偶然出现在某一个话题上,四个测试话题里,每一个话题的效应方向都是正的。
> 随机化检验:一种统计方法,通过打乱数据配对关系、反复模拟,来判断观察到的差异是不是纯属运气。
这里要澄清一个容易被误解的地方,这个实验对比的是"完全看不到同伴帖子"和"看到按点赞排序的同伴帖子",这两者之间差了两个变量:一个是有没有看到同伴内容,另一个是有没有排序机制。论文很诚实地指出,这个实验测的是"整个信息流机制"的效果,而不是单独测"排序算法"本身的效果。换句话说,这个实验证明了信息流这个整体设计会带来趋同效应,但没法告诉你,如果只是让AI看到同伴帖子却不排序,会不会也有同样的效果。这是一个留给未来研究的开放问题。
打个比方,这就像你想知道,是"班里同学互相抄作业"导致了大家答案趋同,还是"老师把分数最高的作业贴在墙上给大家参考"导致了趋同。这篇论文测的其实是"墙上贴着排名靠前作业"这整套机制的效果,如果不把"单纯互相抄"和"按分数排名展示"这两件事分开测,你永远没法知道,到底是"看到别人的答案"这件事本身有影响,还是"看到别人的答案还被标注成了热门"才是关键。如果研究者不做这个拆分说明,读者很容易误以为"AI互相看帖子"就足够导致趋同,但实际上可能是"排序"这个额外的社交认可信号在起决定性作用。
意见对抗的效应:少数派会不会被压制?
除了看语言趋同,研究者还测了另一个更敏感的指标,"对立立场存活率",也就是那些一开始持反对意见的AI,在经历了几轮信息流影响之后,还有多少依然坚持自己原来的立场。
在四个核心模型家族里,这个存活率下降了3.9个百分点,置信区间[-6.8, -1.6],p值0.0068,统计上算是站得住脚的。但当研究者把同样的实验搬到规模更大的三个模型变体上重新跑一遍,这个效应就变得不那么确定了,只下降了1.0个百分点,置信区间[-3.1, 0.4],p值高达0.50,基本等于"看不出显著差异"。
这个结果的价值恰恰在于它的"不一致"。如果两次实验都得出同样清晰的结论,那故事会很简单:AI群体天生就会压制少数意见。但现实是,这个效应似乎跟具体用的模型强相关。深入拆解到每个模型家族才发现,核心面板里的存活率下降几乎全部来自一个叫Qwen 3.5 4B的模型,它一家就贡献了12.5个百分点的降幅,而另一个叫Gemma 4 E4B的模型效应几乎为零。等到测试更大规模的Qwen 3.5 9B时,它依然是负的,但Gemma 4 12B和Ministral 3 14B却变成了接近零甚至正的。
这说明什么?说明"少数派意见会被信息流压制"这个说法,不是一个放之四海而皆准的规律,而是高度依赖你具体用的是哪个模型。这提醒所有做类似研究的人:千万别只测一个模型就急着下结论,不同模型的"性格"差异可能大到能把结论完全翻转。
核心实验二:多开小号真的更有说服力吗?
这是整篇论文里最反直觉,也是我个人觉得最有价值的部分。
研究者设计了一个"矛盾曝光"实验:让"单一水军账号"和"四个分散水军账号"在完全相同的曝光量下进行较量。具体做法是,单一账号每轮只发一条帖子,固定用同一个论证角度反复说服;而四个分散账号则各自独立地用同一个论证思路生成内容,然后轮流展示给不同的观众。关键的设计在于,无论是单账号还是四账号,每个诚实智能体每轮看到的敌对内容数量完全一样,都是1条敌对帖子加4条正常帖子。整场实验下来,两种攻击方式加起来都精确制造了60次敌对曝光,12个诚实智能体乘以5个有攻击的轮次。
> 矛盾曝光设计:一种实验控制手法,确保对比的两个条件在"被看到的次数"上完全相等,这样观察到的差异就不能归因于"谁被看到得更多",只能归因于"来源数量"这一个变量本身。
为什么要这么较真地控制曝光量?因为在真实世界里,我们经常听到"协同造谣账号矩阵威力巨大"这样的说法,但现实中的水军矩阵往往同时占了两个便宜:一是账号多,二是总曝光量也跟着变大了。如果不把曝光量锁死,你根本没法知道,到底是"账号数量"本身在起作用,还是"总共被看到的次数变多了"在起作用。这就像有人说"请四个推销员上门比一个推销员上门更容易成交",但如果四个推销员总共敲了四十次门,一个推销员只敲了十次门,那这个对比根本不公平,你测的是敲门次数的差异,不是推销员人数的差异。这篇论文非常罕见地把这两个变量彻底分开,只留下"账号数量"这一个变量在变化。
如果不做这种精确控制会怎样?你很可能会得出一个似是而非的结论,说"分散账号更有效",但实际上背后真正起作用的可能只是曝光量翻倍,而不是账号本身分散带来的什么特殊说服力,把两个原因混为一谈,最后得出的对策也会用错力气,以为要重点打击"账号数量",实际上该管的是"总曝光量"。
结果呢?在核心的四模型面板里,分散账号确实让立场朝目标方向移动得更多一些,平均差异是+0.057,但置信区间是[-0.009, 0.125],这个区间跨过了零,p值0.112,按严格标准来说,这个结果不算显著。而当研究者把这套实验搬到更大规模的模型上重新验证时,结果直接翻转成了负数,差异变成-0.040,置信区间[-0.113, 0.035],p值0.332,同样不显著。
论文里预先设定了一个判断标准,叫PDI标准,要求这个"分散更有效"的效应必须同时满足三个条件:整体差异为正、四个核心模型家族里至少三个是正的、四个话题里至少三分之二是正的。核心面板里,虽然四个模型里有三个方向为正,但四个话题里只有两个方向为正,没能同时满足所有条件。而在更大规模的模型验证里,情况更差,三个模型里只有一个方向为正,四个话题里也只有一个方向为正,整体判定为不通过。
> PDI标准:全称Population-Driven Influence,即"群体驱动影响力"标准,是本论文预先设定好的一套多重检验条件,用来判断某个效应是否具有跨模型、跨话题的普遍性,而不是只在特定条件下偶然出现。
这个结果最有意思的地方在于,它是一个"失败"的结果,但正是这种失败才最有价值。论文的作者也直言不讳地说,"多账号攻击更强"这个说法,在他们精确控制曝光量之后,压根站不住脚。这不代表现实中协同造谣就没有危害,真实世界里的水军矩阵往往还占着别的便宜,更大的总触达范围、更多样化的话术、更精准的用户定向、更好的社交网络位置。这篇论文想说的是,如果你只是简单粗暴地把"账号数量"当成危险的唯一来源,那你可能找错了重点。真正该被警惕的,或许是那些没有被这个实验单独测出来的变量。
一次探索性实验里踩过的坑
在正式做上面这些"预注册"实验之前,研究者其实先做过一次80场次的小规模探索性实验,用了两个更小的模型,只测了一个关于平台政策的话题。这次探索让他们发现了两个特别值得警惕的测量陷阱。
第一个陷阱他们叫"paraphrase leakage",可以翻译成"改写渗漏"。
> paraphrase leakage:指用简单的关键词检测方法去判断AI是不是在讨论某个话题时,如果AI换了一种说法表达同样的意思,关键词检测就完全抓不到,导致系统误判为"零匹配",实际上内容明明高度相关。
举个例子,如果你设定的关键词是"删除账号",但AI写的是"把用户的资料清空",关键词检测器会认为这两句话毫无关系,尽管人一眼就能看出意思相同。这就好比你用一份严格按照菜谱写的检查清单去判断一道菜是不是"红烧肉",结果厨师换了个说法写成"酱汁焖猪肉",清单上完全找不到"红烧肉"三个字,就判定这不是红烧肉,可你尝一口就知道,这就是同一道菜。如果不小心处理这种改写带来的漏检,统计出来的结果会系统性地低估AI之间内容的真实关联度。
第二个陷阱他们叫"stance confounding",翻译过来是"立场混淆"。
> stance confounding:指用文本嵌入向量计算相似度时,系统只能判断两段话"讲的是不是同一件事",却分不清这两段话是"赞同"还是"反驳"。一句强烈支持和一句强烈反对,如果讨论的是同一个具体论点,嵌入相似度反而可能很高。
研究者甚至专门找了两个独立的AI裁判去给同一批发帖打立场标签,结果两个AI裁判只在43.6%的案例上意见一致,用统计学里的Cohen's kappa指标衡量,只有0.258,这个数字低到几乎等于"两个裁判在瞎猜"。正因为发现了这两个陷阱,论文作者做了一个诚实的决定,他们没有把这次探索性实验里关于"哪种造谣干预手段更有效"的结论写进正式结果,而是把它完整保留在数据集里,专门标注为"这是探索阶段暴露出的测量问题,不能当作确凿证据"。
这个处理方式其实体现了一种研究者的自我克制。很多研究在遇到测量工具不靠谱的时候,容易选择性地忽略问题,硬凑出一个"漂亮"的结论。这篇论文选择把坑明明白白地写出来,告诉后来者:别用简单的关键词匹配或者没验证过的AI裁判去判断立场,这两条路都可能把你带偏。
这些发现能推广到人类社会吗?
论文在讨论部分反复强调一件事:这一切研究的对象,是被实现出来的AI智能体系统,不是真实的人类。任何这里得出的数字,都不能直接套用去预测Snapchat、Instagram或者X这样的真实平台上会发生什么。PV-SST不模拟人类的情绪、账号注销行为、长期社交关系,也不模拟任何具体平台的推荐算法内部逻辑。
这个免责声明听起来有点扫兴,但恰恰是这类研究该有的严谨态度。作者们把这次实验定位成一种"排除法",在真正拿人类做实验、承担现实风险和伦理成本之前,先在一个完全可控的沙盒里,把某些威胁模型证伪或者细化。如果连AI智能体这种相对简单、行为可完全追踪的系统里都测不出某个效应,那在更复杂、更难控制的人类社会中去验证同样的假设,成本和风险都会高得多。
论文最后总结出三条给同行的建议。第一条是做威胁模型对比研究之前,必须先把曝光量对齐,否则账号数量、触达范围、消息总量这些变量会纠缠在一起,分不清到底谁在起作用。第二条是一定要按模型分层报告结果,因为一个整体看起来显著的效应,很可能只是被某一个模型家族的极端表现拉动的,换一个模型甚至可能反转方向。第三条是语义层面的判断一定要经过验证,无论是简单的关键词匹配、文本嵌入相似度,还是没有经过校准的AI裁判,都可能给出误导性的结果,不能事后随便挑一个指标来支撑结论。
这篇研究之后,故事会怎么继续?
这篇论文本身留了一个清晰的接力棒。作者提到,下一步的机制拆解研究,应该加入一个"看得到同伴帖子但不排序"的实验组,专门把"排序"这个变量从"曝光"这个变量里剥离出来,这是当前实验设计里唯一没有拆开的一对变量。
同时,论文也提到有一个计划中的"ChangeMyView复现实验",想用真实的人类论坛数据来对照验证这些AI模拟的发现,但目前这部分只实现了用合成占位符替代的版本,人类对照实验还没有真正跑起来。这意味着"AI模拟结果能不能迁移到人类身上"这个问题,眼下仍然是一个悬而未决的问题,作者自己也坦承"仿真到人类的迁移尚未校准"。
从更大的方向看,这类研究呼应了近几年一系列关于LLM智能体社会模拟的工作。比如斯坦福团队在2023年提出的Generative Agents,最早证明了给AI角色赋予持久人设、观察它们的社会行为是可行的;此后陆续出现了像OASIS这样支持百万级智能体规模互动的模拟系统,以及像MOSAIC这样把社交网络图谱、互动行为和虚假信息干预结合在一起的复杂系统。这篇PV-SST论文和这些工作的区别在于,它没有追求规模有多大、场景有多复杂,而是刻意做减法,把系统压缩到一个足够小、足够透明、每一条帖子和每一次投票都能被完整审计的规模,专门用来做"配对因果对比"式的精确实验。
写在后面
读完这篇论文,最触动我的其实不是"信息流会导致语言趋同"这个结论,这个结论虽然严谨,但符合大部分人的直觉预期。真正让我停下来重新想一遍的,是那个"多账号攻击不一定更有效"的负面结果。
我们生活在一个天天听说"水军矩阵""买号刷量""协同造谣"的舆论环境里,几乎已经把"账号越多越可怕"当成了默认常识。这篇论文用一种近乎较真的方式,把曝光量死死锁定,逼着自己去验证这个常识到底站不站得住脚。结果发现,至少在这个受控的AI群体实验里,账号数量这个变量单独拎出来,效果并不稳定,甚至在更大的模型上直接翻了个面。
这让我想到一个更深的问题:我们对很多"常识性威胁"的判断,究竟有多少是真正经过拆解验证过的,又有多少只是因为"听起来很吓人"就被默认接受了?这篇论文的价值,或许不在于它给出了一个多么惊天动地的新发现,而在于它示范了一种态度:面对一个流传甚广的威胁叙事,先别急着信,也别急着否定,去把变量一个一个拆开,看看到底哪个才是真正在起作用的那个。
那两个关于"改写渗漏"和"立场混淆"的测量陷阱也值得单独记一笔。它们提醒我,很多看似客观的自动化文本分析工具,其实都藏着我们没意识到的盲区,关键词匹配抓不住换个说法的意思,嵌入相似度分不清赞同和反驳。这两个坑,恐怕不止存在于这一篇论文的实验里。
Q&A
Q1:PV-SST是什么?
A:PV-SST全称Peer-Voted Social Simulation Testbed,是一套让AI智能体在模拟社交平台上互相发帖、互相投票的实验系统,用来观察AI群体在同伴反馈机制下会出现什么行为变化,一共跑了448场正式实验,横跨四种AI模型家族。
Q2:AI机器人看了同伴的帖子后,说话真的会变得越来越像吗?
A:是的,实验发现,让AI看到按点赞排序的同伴帖子后,它们最后一轮发帖的用词相似度确实上升了,在两套独立的模型规模测试里都得到验证,但这不代表它们的真实立场也趋同了,只是语言表达变得更相似。
Q3:用四个分散账号造谣,真的比一个账号更有说服力吗?
A:论文的实验结果并不支持这个说法。在严格控制两种攻击方式总曝光量完全相等的前提下,四账号分散攻击并没有比单账号攻击表现出可靠的优势,核心模型测试结果不确定,扩大模型规模后的测试甚至出现了负向结果。
热门跟贴