这项由日本NTT公司研究人员开展的工作,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18806,感兴趣的读者可通过该编号在arXiv平台查阅完整原文。
你有没有遇到过这种头疼的场景?
朋友圈里计划一次出游,三五个人各有想法:有人要逛古迹,有人要吃美食,有人只想省钱,有人体力不好要控制步行距离。群聊里讨论来讨论去,消息刷到几百条,最后要么是嗓门最大的人说了算,要么是没有主见的人委屈妥协,要么干脆散伙。
这个让人头疼的问题,NTT的研究团队决定用一种新颖的方式来解决:让多个拥有不同"性格"和"偏好"的AI,模拟真实的人类讨论,自己协商、争论、投票,最终商量出一份大家都能接受的旅行计划。他们把这套系统叫做"AI Tour Meeting"(AI旅游会议)。
这个框架的意义不仅仅在于帮人规划旅行。更深层的价值在于,它提供了一个可以观察多个AI如何在分歧中寻求共识的"实验室",帮助研究人员理解AI在群体决策中的行为规律,同时也能用来测试和评估现有的团体旅行推荐系统。与此同时,它还有一个很实用的应用场景:假如你们小组里有人临时来不了,可以根据他的喜好创建一个AI"替身",让这个AI代表他参与讨论,确保缺席者的意见也被纳入考量。
一、这套"AI圆桌会议"到底是怎么运作的?
整个框架的运作逻辑,可以用一场真实的公司会议来类比。在会议开始之前,你需要确定两件事:参会者是谁,以及会议怎么开。
先说参会者。每一个AI参与者都被赋予了一套完整的"人设",就像给演员写角色背景一样详细。这套人设包含名字、个人经历与背景、性格特点、对旅行的偏好、这次旅行的个人目标、在会议中的角色(是主持人还是普通参会者)、说话的语气风格,以及说服别人时惯用的方式。
关于说服方式,框架提供了两种截然不同的风格。一种是"主观表达型",就像一个很感性的朋友,不断强调"我觉得这个地方特别棒,符合我的品味";另一种是"对比分析型",更像一个理性的分析师,会拿出数字和事实说话,比如"你看,我提的这条路线比现在的方案少花200元,而且能多去一个景点"。当然也可以选择两种混用,或者让AI根据当时的情形自己判断哪种方式更合适。
每个AI参与者背后可以接入不同的语言模型,可以是商业模型(比如OpenAI的GPT系列),也可以是在本地服务器上运行的开源模型(通过vLLM或Ollama部署)。每个参与者的模型类型、随机程度(temperature参数)、记忆管理方式都可以单独配置,灵活程度相当高。
再说会议本身的结构。一次完整的AI旅游会议由全局目标、参与者名单、约束条件、发言规则和投票规则五个要素组成。全局目标是所有人共同遵守的大方向,比如"规划一次东京一日游"。约束条件则是硬性限制,包括出行日期、总预算和时间窗口(比如只能在早上九点到晚上六点之间活动)。每个参与者在这些约束条件下追求自己的个人目标,这就造成了分歧,也推动了讨论的进行。
整个会议在一份具体的"行程单"格式上展开讨论。每一份被提出的行程单,都包含一个按顺序排列的目的地序列,每个目的地都注明了名称、描述、费用、到达时间、停留时长,以及从上一个地点出发的交通方式、交通费用和耗时。这种结构化的格式确保了AI在讨论时有具体的内容可以评判和修改,而不是只讲模糊的意见。
二、会议的节奏:对话与投票交替进行
会议的推进方式有点像一场辩论赛的精简版,分为"对话阶段"和"投票阶段",两者交替进行。
在对话阶段,参与者按照规定的顺序轮流发言。每个人在自己的发言回合里,可以做好几件事:可以通过网络搜索查询某个景点的具体费用或交通时间;可以向其他参与者提问,收集他们的意见;可以静下来"反思"一下,整理当前讨论的思路;当然,最重要的,是可以提出一份具体的行程方案。
每个回合必须以一个"终结动作"收尾。在对话阶段,终结动作有三种选择:提出新的行程方案、表示对当前方案已经满意、或者选择本轮不表态直接跳过。一旦有人提出了新的行程方案,会议立刻进入投票阶段。
投票阶段里,除了提案人以外的所有参与者,都需要对这份方案表态。在表态之前,他们同样可以先搜索信息、向别人提问或者思考一番,然后做出"接受"或"拒绝"的最终决定。投票结果按照预先设定的投票规则来判定。如果方案通过,当前的行程单就被这份新方案取代;如果被否决,原来的方案继续保留,会议回到对话阶段,轮到提案人之后的下一位继续发言。
当所有参与者在连续的回合中都表示"对当前方案满意"时,会议达成共识,圆满结束。当然,为了防止会议无限循环下去,系统也设置了最大发言轮数和最长运行时间的上限,确保会议总会有个终点。
这个"对话—投票—对话"的循环过程,用一套形式化的算法描述得非常清晰:系统维护一个计数器,记录连续表示"满意"的参与者数量。每当有人提出新方案,计数器清零,重新开始。只有当计数器的数值等于总参与人数时,会议才算真正结束,此时的行程单就是最终结果。
三、发言顺序和投票方式,可以按需定制
这套框架在"游戏规则"的设计上给了使用者相当大的自由度,发言规则和投票规则都有多种选项可以选择。
发言规则方面,有四种基本模式。"轮流发言"是最简单的,大家按照固定顺序一人一轮;"邀请制"则是由当前发言者在结束时点名谁来接着讲,更接近真实会议中的互动方式;"主持人制"是在每个人发言之后,插入一个额外的主持人回合,由主持人决定下一个发言者是谁;"随机制"就是随机确定下一个发言者。此外还有两个可选的附加设置:开启"均衡模式"后,发言被组织成一轮一轮的循环,确保每位参与者在每轮里都有机会说话,避免某些人被边缘化;开启"自愿模式"后,参与者可以选择在自己的回合里什么都不说,直接跳过,只有真正有话说的人才需要开口。
投票规则方面,框架提供了五种选择。"多数票制"是最常见的民主方式,获得超过半数的赞成票方案通过;"全票制"要求所有人都同意,门槛极高;"单一决策者制"是让指定的某一个参与者独自决定方案的命运;"最高满意度制"和"最低不满意度制"这两种更有意思,参与者不再投二选一的票,而是给方案打一个1到10分的分数,前者看的是总分,后者看的是最低分(即最不满意的那个人的分数),后者的逻辑是:一个方案哪怕总分再高,只要有人极度反对,也不应该通过。
四、框架有多好用?用不同大小的AI模型测了一遍
光有设计还不够,研究团队还做了严格的测试,看看这套框架在不同能力的AI模型下表现如何。
测试方法是这样的:先用一个能力较强的模型(GPT-5.4 mini)生成50个不同的"会议场景",每个场景里三名参与者的偏好部分重叠、存在一定程度的分歧,但分歧不算特别激烈,通过协商可以解决。然后,用五种不同大小和能力的模型来驱动这50场会议,看看各自表现如何。这五种模型分别是:Qwen3.5的2B、4B、9B版本(数字越大代表模型越大、能力通常越强),以及两个商业模型gpt-oss-20b和gpt-5.4-mini。所有会议都使用轮流发言规则和多数票投票规则,设置100轮的上限,时间窗口为早九晚六,每位参与者预算为100美元。
测试结果相当清晰地说明了问题。能力最弱的Qwen3.5-2B,只有82%的会议能顺利完成(即在达成共识或触及上限之前,至少接受了一份行程方案),而且其中只有58%的会议是真正通过协商达成共识结束的,剩余的是被强制截止的。更糟糕的是,它提出的行程方案中有高达14.2%违反了时间或预算约束,而且频繁出现奇怪的行为——比如重复发同一条消息,或者拒绝某个方案时提到了一条根本不存在的"当前路线"。
而其他四种更强的模型,完成率都达到了100%,违规比例接近于零,行动失败率也极低。其中Qwen3.5-9B的表现尤为出色,违规率为0%,失败率仅0.1%,平均只需要12.8轮发言就能结束会议。GPT-5.4 mini虽然完成率也是100%,但共识率只有80%,意味着有20%的会议是在没有完全达成共识的情况下被截止的,这可能与该模型的某些倾向有关。
从成本角度看,不同模型的差异也很显著。Qwen3.5-9B每场会议消耗约13.4万个输入token和3.7万个输出token,而Qwen3.5-2B由于讨论更混乱、绕路更多,每场会议消耗的token高达710万个输入,是9B模型的五十多倍。这个对比直观地说明了:一个"够聪明"的模型,不仅结果更好,而且效率更高。
综合来看,Qwen3.5-4B是这套框架能够稳定运行的最低门槛,性能高于这个级别的模型都能让框架运转良好。
五、当AI们意见不合时,会发生什么?
框架能跑通只是第一步,更有趣的问题是:当参与者的偏好相互冲突时,AI们会怎么处理?这跟真实的人类讨论像不像?
研究团队专门设计了一个分析实验。他们把50个会议场景分成三组:第一组"一致型",三位AI参与者的偏好完全对齐,大家都想去差不多的地方;第二组"混合型",就是前面系统测试用的那种,偏好部分重叠有一定分歧;第三组"冲突型",三位参与者的偏好存在实质性矛盾,至少有一个人在某些方面必须做出让步才能达成协议。全部使用邀请制发言规则和Qwen3.5-9B。
每场会议结束后,研究团队还用LLM-as-a-judge(让另一个AI扮演评委)来评估每位参与者对最终行程的满意度,打1到10分。
结果显示出了非常自然的规律性。一致型会议平均只需要10.3轮就能结束,提出2.3次行程方案,共识率100%,平均满意度高达8.93分,只有0.7%的参与者对最终结果极度不满(满意度4分或以下,被称为"受害者")。
混合型会议稍微费劲一些,平均12.1轮,2.7次提案,共识率仍然100%,满意度8.39分,受害者比例1.3%。
冲突型会议则明显吃力得多:平均25.9轮才能结束,提案次数高达6.5次,共识率下降到94%,平均满意度跌至7.13分,受害者比例飙升到11.3%。
这组数据讲述了一个耳熟能详的故事:分歧越大,讨论越久,越难找到让所有人都满意的方案,被迫妥协的人也越多。AI的行为模式和人类社会中的群体讨论规律高度吻合——这本身就是一个很有价值的发现,说明这套框架确实能够模拟出真实的人类群体决策过程。
研究团队还从会议记录中提取了两个典型的案例,展示了AI在冲突情境下如何达成共识。第一个案例发生在一场首尔一日游的混合型会议里。一位叫Elena的AI参与者提出的方案被连续否决了九次。另一位参与者Jisoo实在等不下去了,直接问Elena:经过这15轮讨论,你是否愿意接受目前这份方案,好让我们结束会议?Elena承认自己对路上的街头小吃和清溪川散步念念不忘,但也看到了其他人的坚持,最终选择了妥协。在赛后评估中,Elena给这份方案打了3分,说明她是在真正不满意的情况下才接受的——这是一种被压力推动的妥协,而不是真心满意。
第二个案例则温馨得多,发生在一场马拉喀什一日游的冲突型会议里。Noah的方案被否决了两次之后,另一位参与者Leila自己站出来,提出了一份融合了Noah的需求的新方案,把Noah最想去的屋顶观景台纳入了行程,同时也保留了第三位参与者Camille最在意的宁静茶馆时光(虽然时间略有缩短)。这一次,Noah接受了,Camille虽然略有遗憾但也表示满意。Leila用一种调解者的姿态,打破了僵局。
这两种截然不同的共识路径——一种是被动妥协,一种是主动调解——在AI的讨论中自然浮现,令人印象深刻。
六、先说话还是后说话,影响有多大?
除了偏好冲突,研究团队还好奇另一个问题:在讨论中,发言顺序会影响一个人提案被接受的概率吗?毕竟在现实会议中,第一个发言的人往往有"定调"的作用,但也可能因为信息不足而打出"盲拳"。
这个实验的设计颇为严谨。研究团队把前面三种冲突程度的50场会议,各自再运行三遍,每次把三位参与者的座位(即发言顺序)进行轮换,覆盖所有可能的排列方式(这种方法在统计学上叫"拉丁方设计",目的是排除特定参与者偏好对顺序效应的干扰)。所有会议使用轮流发言规则。
结果在一致型组里,第一、二、三位发言者的提案接受率分别是62%、64%、66%,三者没有统计学上的显著差异——说明当大家都想去同样的地方时,谁先说都无所谓,方案总会被接受。
但到了混合型组,格局明显不同:第一位的接受率是43%,第二位是68%,第三位是73%。冲突型组的差距更加悬殊:第一位只有32%,第二位46%,第三位48%。
这意味着什么?在存在分歧的情况下,越晚发言的人,提案越容易被通过。原因合乎直觉:第一位发言者什么信息都没有,只能凭借对自身偏好的判断来提案,很难兼顾到其他人的需求。而后面发言的人,已经从前几轮的讨论、提案和投票结果中积累了大量信息,知道哪些地方被别人接受、哪些被拒绝,因此能够提出更精准地迎合多方需求的方案。
有趣的是,数据还揭示了一个额外的细节:第一位发言者中,那些被接受的提案大多数是在先向其他人提问、收集意见之后才提出的;而后面发言的人,往往不需要专门提问,仅靠之前讨论中自然积累的信息就能提出被接受的方案。换句话说,第一个吃螃蟹的人要获得成功,需要更主动地去探索,而后来者则可以"坐享其成",把前人的讨论当成免费的市场调研。
七、给人类留了一把椅子
这套框架还有一个很人性化的设计:真实的人类用户也可以参与进来,和AI一起开会。在轮到人类发言时,系统会提供一个聊天界面,人类可以执行和AI完全相同的操作——搜索信息、向AI提问、提出行程方案或者投票表态。
在提出行程方案时,人类可以手动修改每个目的地的细节,也可以点击"用AI生成"按钮,把自己的想法描述给AI,让AI帮忙补全一份完整规范的行程方案。
这个人机混合模式的最直接应用场景,就是前面提到的"替缺席朋友发声"。假如你们五人小组里有两个人出差来不了,你可以根据他们平时的偏好,分别为他们配置一个AI"替身",让这个AI代表他们参与你与另外两位朋友的讨论,确保行程计划真正考虑到了所有人的需求。
八、用的人越多,系统会不会崩?
为了验证框架的可扩展性,研究团队还额外测试了当参与者人数增加时,系统能否稳定运作。他们同样生成了50个合成场景,分别测试了5人和10人规模的会议(用Qwen3.5-9B驱动),其他设置与三人场景保持一致。
结果令人放心:5人组和10人组的完成率均为100%,10人组的共识率也高达96%,违规率分别为1.6%和2.4%,仍然处于很低的水平。不过代价是会议变长了——5人组平均需要25.4轮,10人组则需要68.6轮,比三人组的12.8轮高出了很多,而且增长速度略快于参与者数量的增长比例。这说明随着讨论人数增加,协调难度会非线性上升,但在实际可用的范围内。
token消耗也相应大幅增加:三人组平均消耗约17万个token,5人组约76万,10人组约348万。这意味着如果在商业API上运行大规模会议,成本会相当可观,使用本地部署的开源模型可以有效控制费用。
九、这套系统可以怎么用?
从使用方式来看,这个框架提供了两种接入途径。一是图形界面,提供了清晰直观的操作页面:左侧配置每位参与者的详细信息,中间设置会议的全局规则和约束条件,右侧是实时滚动的会议对话记录,最右边则是分析仪表盘,可以可视化地查看各类统计指标。二是Python代码接口,只需要几行代码,就能配置好一场会议并启动运行,非常适合需要批量生成和分析大量会议的研究人员。
系统还内置了丰富的监控和分析功能。系统层面的指标包括token消耗量、操作失败重试次数、行程方案中违反时间约束的情况;讨论动态层面的指标包括发言轮数、消息历史、各类操作的执行分布、投票和打分的分布情况、以及历次提案的具体内容和演变过程。这些数据可以帮助研究者从多个维度深入分析AI群体决策的行为模式。
归根结底,这项工作做的是一件颇具想象力的事情:把旅行规划这个烦人但日常的问题,转化成了一个研究AI如何在多元偏好中寻找平衡点的实验平台。它证明了AI在处理有分歧的群体讨论时,确实能涌现出类似人类的行为模式——比如越晚发言越有优势、强调共同妥协可能让部分人心有不甘、以及善意的第三方调解有时比反复对抗更高效地打破僵局。
当然,这项研究更多是一个开端,而不是终点。AI生成的"人设"和真实人类有多大的差距?这种模拟的结论能不能直接指导真实的推荐系统设计?随着模型越来越强,AI的协商行为又会如何演变?这些都是值得深入探索的方向。有兴趣的读者可以通过arXiv编号2607.18806找到完整论文,也可以访问论文中提供的GitHub代码仓库,亲自动手试试让几个AI帮你规划下一次旅行。
Q&A
Q1:AI Tour Meeting框架支持哪些投票方式?
A:框架提供五种投票规则。多数票制下,超过半数赞成即通过;全票制要求所有人同意;单一决策者制由指定参与者独自决定;最高满意度制看的是所有参与者打分的总和;最低不满意度制则看的是最低那个分数,确保不会出现有人极度反对还能通过的情况。参与者在后两种规则下打的是1到10分的分数,而非简单的赞成或反对。
Q2:AI Tour Meeting框架最少需要多强的AI模型才能稳定运行?
A:根据系统测试结果,Qwen3.5-4B是这套框架能够稳定运行的最低门槛。比这更小的Qwen3.5-2B会出现重复消息、引用不存在路线等异常行为,完成率只有82%,违规率高达14.2%。而Qwen3.5-4B及以上级别的模型,完成率均达到100%,违规率和失败率都极低。
Q3:发言顺序对AI旅游规划讨论有什么影响?
A:在偏好存在分歧的情况下,越晚发言的参与者,提案被接受的概率越高。以冲突型会议为例,第一位发言者的提案接受率只有32%,而第三位高达48%。原因是后发言者能利用前面讨论积累的信息来优化提案,而第一位发言者缺乏参考,通常需要先主动提问才能提高成功率。偏好完全一致时,发言顺序则没有明显影响。
热门跟贴