12个国内顶尖AI,1248次残酷校验,超4600万民众参与。

当2026年美加墨世界杯的战火点燃,赛场外的另一场“诸神之战”也拉开帷幕——2026年世界杯期间,联想集团与咪咕视频共同发起“世界杯预测人机大战”。联想天禧AI作为召集者,与DeepSeek、千问、中移九天、百度文心、腾讯混元、Kimi、智谱、MiniMax、阶跃、讯飞星火和商汤小浣熊组成AI预测阵营,与体育嘉宾、专业人士和数千万普通用户面对同一张赛程表。

这是全球首个由多个AI大模型与全民同场参与、覆盖世界杯完整赛程、由真实赛果逐场验证的人机预测产品。世界杯开赛前,AI与用户共同预测32强晋级名单;开赛后,预测覆盖全部104场比赛,围绕胜平负、精确比分和冠军归属持续作答。随即开播的综艺节目《人机大战:谁是世界杯预言家》,则使这场持续一个多月的实验彻底破圈,成为可以被观看、被讨论的公共事件。

截至7月12日,第100场世界杯比赛结束,这场人机预测实验已经积累起一组足够完整的连续样本。联想集团与咪咕发布《世界杯预测人机大战百场观察——AI的优势、差异与边界》报告,对前100场比赛的预测结果进行系统统计:AI共完成1200次胜平负判断,命中788次,整体命中率为65.7%,比同期公众用户58.9%的平均命中率高出6.8个百分点。

AI大模型的能力验证,长期依赖实验室榜单和标准化测试的技术指标,但与真实应用场景始终存在距离。在联想的搭台下,来自不同厂商、彼此竞争的11个AI大模型,首次被置于同一规则却又持续变化的极限场景下接受连续检验,形成了一份跨厂商、真实场景、公开可验证的AI能力样本。

人机大战从此进入下一个阶段。

从棋盘到绿茵场:机器第一次走出了封闭系统

从棋盘到绿茵场:机器第一次走出了封闭系统

1997年,IBM Deep Blue击败国际象棋世界冠军加里·卡斯帕罗夫。

国际象棋拥有确定规则、完整信息和明确胜负。机器的核心优势来自计算速度、局面搜索和评估深度。Deep Blue证明,在边界清晰的复杂任务中,计算机可以找到人类顶尖棋手也难以应对的行动路径。

2016年,AlphaGo以4比1击败李世石。

围棋的状态空间远大于国际象棋,单纯依靠穷举已经不可行。AlphaGo通过神经网络、强化学习和自我对弈形成策略判断。机器开始处理直觉、形势和长期收益,但棋盘、合法动作和胜负条件仍然明确。

2017年,Libratus在无限注德州扑克中击败四名职业牌手。

扑克引入了隐藏信息和欺骗。机器看不到对手手牌,需要在信息不完整的条件下推断对方策略,并避免自己的行动被识别和利用。人机大战由完全信息博弈进入不完全信息博弈。

2019年,AlphaStar在《星际争霸Ⅱ》中达到宗师级水平。

即时战略游戏进一步加入实时操作、资源分配、局部信息和多任务管理。机器需要同时处理短期战斗和长期发展,并根据不断变化的战场调整行动。

这些比赛的难度持续上升,却拥有一个共同条件:机器始终在一个预先设定的系统中行动。游戏规则明确,结果评价明确,机器能够通过重复训练生成大量相似样本。即使对手的策略难以预判,机器仍可以选择动作、影响局面,并从每一次结果中修正下一步。

这是一个边界清晰的封闭系统:无论对手是国际象棋冠军、围棋高手、扑克牌手还是游戏选手,AI证明自己的方式,始终是在一个可以被穷尽或反复模拟的确定系统里,找到比人类更优的策略。

世界杯预测人机大战改变了这一前提。AI不在场上踢球,无法决定阵型、换人和射门,也无法让同一场比赛重新进行。它只能读取赛前可以获得的信息,然后等待22名球员、教练、裁判和现场环境共同产生唯一一次结果。伤病、红牌、天气、球员发挥、临场换人、积分策略和心理状态,都可能改变比赛,其中一部分信息无法提前完整进入数据。

这套机制提供了实验室测评难以复制的条件:一是题目公开。所有参与者面对相同的对阵和基本赛前信息;二是答案公开。终场哨响之后,赛果不会因模型、用户或品牌而改变;三是评分公开。胜平负、比分和晋级结果按照统一口径结算;四是失误公开。模型的命中、分歧、共识和集体误判进入节目、媒体和社交平台,接受持续复盘。

这不是完全可控的科学实验。不同赛段的难度、信息量和比赛类型都在变化,历史数据可以告诉AI哪一种结果更可能出现,但AI却无法预知场上的变化,任何一次失误、一次反击甚至最后几分钟的机会,都可能决定一支球队的命运。104场比赛也不再是棋盘上同一道题的重复计算,而是104个条件不断变化、信息并不完整的独立事件。

AI们,欢迎来到持续变化的开放系统。

百场数据全景:AI没有神话,只有边界

百场数据全景:AI没有神话,只有边界

“我们并不试图寻找一个无所不知的‘大预言家’,而是希望通过连续百场数据,观察多个AI在真实场景中展现了什么能力、形成了什么差异,又暴露出了哪些共同边界。”前述联想《人机大战百场观察》报告指出。

该报告给出了最重要的阶段性结论:第一,AI的优势是长赛程磨出来的,不是从一开始就存在。 6月13日,AI命中率只有43.8%,公众用户为54.4%,AI一度落后10.6个百分点;到6月18日,AI升至48.6%,公众降至45.0%,两条曲线首次交叉完成反超;此后AI整体保持领先,到第100场结束时,将差距扩大至6.8个百分点。咪咕视讯副董事长、总经理李黎将这一现象概括为“平均值的提升”:AI更擅长在高频、连续、信息复杂的场景中抬高长期判断的平均线,而不是把每一场比赛都变成确定答案。

打开网易新闻 查看精彩图片

第二,没有一个 AI 能通吃:每个赛段都有不同“冠军”。具体而言,赛前32强预测中,腾讯混元以29/32命中率排名第一;72场小组赛结束,中移九天与腾讯混元并列首位;32进16阶段,千问以87.5%的命中率单独领先;16进8阶段,腾讯混元、Kimi和讯飞星火三家并列;8进4阶段,9个模型同时打出4场全中;截至前100场累计总榜,中移九天以71场暂居第一,但仅领先第二名1场,前六名之间的差距也只有3场。

打开网易新闻 查看精彩图片

连续命中纪录又给出了不同的排名。千问曾连续命中14场,阶跃连续命中13场,MiniMax连续命中12场。拥有最长连续命中纪录的模型,并未成为百场累计总榜第一。短期连续判断准确,与长赛程中持续减少失误,是两种不同能力。

联想《人机大战百场观察》指出,世界杯最终会产生一支冠军球队,但这场 AI 预测实验很难用一个“冠军”概括。只看 32 强预测、某轮淘汰赛、最长连续命中或累计总榜,都会得到不同答案。样本越短,单场结果对排名的影响越大;样本越长,持续减少失误的能力越重要。

因此,这一条持续走高的AI预测领先曲线,本质上是12份答卷叠加出来的平均值,而不是任何单一模型独自完成的胜利。同时,不同模型的优势具有明显的场景和阶段特征,AI的能力应当在连续、分层和可验证的数据中衡量。

当AI失灵:预测市场的盲区

当AI失灵:预测市场的盲区

全球市场里还存在一套历史更悠久、逻辑完全不同的概率生成机制——预测市场。

以本届世界杯为例,全球最大的预测市场平台Polymarket上,围绕“世界杯冠军”单项市场的累计交易额已超过42亿美元。这类平台通过让数千名参与者用真实资金实时聚合分散在市场中的信息与判断,价格随新信息持续更新。

预测市场产品和“人机大战”的逻辑并不一致:前者靠着“信息越有价值、下注意愿越强”这一经济激励机制,自发筛选出群体智慧,针对概率投票;后者依靠的是大模型对结构化历史数据和实时信息的整合推理。

但是,联想《人机大战百场观察》报告的另一个结论,有效验证了预测市场的盲区:系统性偏差。

学界早就发现,预测市场里的参与者存在一种“非胜即负”的思维定式,会系统性低估平局发生的概率。此次人机大战则验证了这一现象:面对76场最终分出胜负的比赛,12个AI的方向命中率达到81.0%,高于公众用户的71.8%;但在24场平局中,AI与公众的命中率分别降至17.0%和16.0%。AI在胜负题上建立的明显优势,到了平局几乎完全消失。

前100场比赛中,有15场出现12个AI全部判断错误,其中11场来自平局,另外4场由赛前不被看好的一方获胜。平局占集体失准的近四分之三,构成AI预测中最稳定、最清晰的难题。

打开网易新闻 查看精彩图片

AI和人类都习惯寻找一个胜者,也都系统性低估了比赛不分胜负的可能。平局是比赛过程对纸面实力的一次折损:强队可能占据控球和射门优势,却迟迟无法进球;弱队可能通过密集防守压低比赛节奏。在本次世界杯大放异彩的西非岛国佛得角,正是靠着这一战术,以及门将沃齐尼亚精湛技术和非凡表现,逼平西班牙、战平乌拉圭,让AI与人类预测“集体翻车”。

无论是靠资金定价的市场,还是靠数据推理的模型,这类藏在战术意图和临场发挥里的信息,都很难被结构化数据充分捕捉——市场和模型,在这一点上没有本质区别。

据联想《人机大战百场观察》报告统计,前100场中,有40场比赛出现12个AI 全票判断同一方向,其中10场全票一致却集体失准。“AI最危险的时候,未必是意见分裂,而可能恰恰是所有模型都觉得自己不会错的时候。”报告指出,高共识意味着多个模型可能从相似信号中提取出相近结论,但当关键变量没有被纳入时,反而可能放大共同盲区。

这背后的机制在于,当多个AI大模型共享相近的信息来源与权重体系时,它们给出的与其说是相互独立的判断,不如说是在同一概率空间里做的收敛计算。而一旦走向低概率场景,这种收敛反而会放大系统性偏差。

这也是本次“人机大战”更具产业参考价值的地方:在金融市场、供应链预测以及企业决策系统中,如果多个AI模型被同时用于需求预测、风险评估或资源配置,并且底层依赖相似的数据源与推理逻辑,那么一旦外部环境发生结构性变化,这些模型可能同时低估或高估风险,从而形成同步性决策偏差。

AI赢下平均值,人类创造峰值

AI赢下平均值,人类创造峰值

6月30日晚,《人机大战:谁是世界杯预言家》节目连线了一位29岁的重庆彭水贴砖工人李先生。他从2014年巴西世界杯开始看球,是C罗的铁杆粉丝。这一次,他在32强晋级名单的竞猜中32中31,力压场上所有AI模型和专业解说,成为“全场唯一”。按照世界杯扩军至48队后的赛制,小组赛阶段要从12个小组预测出32支晋级球队,若完全随机填写,最终32中31的概率约为1.81亿分之一,相当于连续猜对27到28次硬币正反面。

按联想《人机大战百场观察》报告测算,在纯随机选择和掌握分组信息两种简化假设下,31/32分别对应约1/1.81亿和1/212万的参照概率——这使他成为超过3500万参与用户中最突出的个体。他的判断更多来自长期看球积累的经验。

打开网易新闻 查看精彩图片

这个样本不能证明人类整体比AI更准确,也不能证明这名球迷能够在下一届比赛中复制同样的成绩。它说明的是,即使机器已经提高了整体平均水平,人类个体仍可能依靠长期观赛经验、对特定球队的熟悉程度和独立判断,达到所有模型都未能抵达的高点。

心理学家菲利普·泰特洛克通过长期主持的“良好判断力项目”发现,表现优秀的预测者通常不依赖天赋或一次性的直觉。他们保持开放心态,将判断建立在多种可能之上,并根据新证据不断修正结论。高质量预测的关键,不在第一次是否押中,而在于能否持续吸收信息、校准判断并复盘错误。

世界杯人机大战呈现出相似的观察维度。联想《人机大战百场观察》报告披露,截至前60场,公众用户平均每场修改预测约1.04次,AI平均约1.6次;阶跃平均每场修改约3.3次,累计调整220次。不同模型在答案更新频率上存在明显差异。

更新频率本身不能证明判断质量更高。频繁修改可能来自对新信息的及时响应,也可能意味着模型容易受到短期信号干扰。但它说明,开放世界中的预测能力不能只看初始答案,还要考察模型是否能够识别新证据,并在必要时改变原有结论。这正是前述“超级预测者”的心理学逻辑。

AI擅长处理大量结构化信息,在连续任务中控制失误,提高整体判断的平均线;人类的表现更加分散,稳定性较弱,却可能凭借经验、差异化信息和独立判断创造更高峰值。两种能力并不互相否定,它们共同构成了真实世界中的判断结构。

“AI提高的是整体平均水平,人类则留下了这个夏天最难忘的峰值时刻。”联想《人机大战百场观察》报告总结道。

联想:不做大模型,做全球AI生态的连接者

联想:不做大模型,做全球AI生态的连接者

世界杯留下的,不只是一条65.7%的AI命中率曲线,也形成了一套把模型、场景、用户和真实结果放进同一体系的公开测试。作为全球AI生态链领军企业联想,正是扮演这个生态的组织者与连接者——在一个无法被完全计算的开放世界里,比“谁更准”更重要的问题,是谁能把足够多互相竞争的能力,持续、公开地连接进普通人可感知的真实场景。

因此,对普通消费者而言,这是一次AI预测技术下沉的科技狂欢;但对分析师和机构投资者来说,它更像是联想集团过去40年在AI时代的一次公开定位。

组织人机大战的主体——那个说服中国AI产业中彼此竞争最激烈的对手们出现在同一个平台、共同参与104场比赛预测的公司——不是监管,不是风险投资机构,也不是技术标准组织,而是联想集团。

世界杯让联想集团找到了它在这场全球AI竞赛中最擅长扮演的角色——不是站在台前证明谁的模型更强,而是把算力、模型、终端、供应链和用户连成一张网。

作为活动的召集者,联想天禧AI的表现也更贴近商业现实。它没有在任何单项上拿到过第一,却在赛前32强预测、72场小组赛、32进16阶段和前100场累计总榜四个关键节点上全部进入前四,是12个AI中唯一全程不掉队的模型。对于正在将智能系统接入供应链、客户服务和决策支持体系的企业而言,这种长期可靠性,往往比偶然的高光时刻更具实际意义。

若将AI生态从大模型向算力基建延伸,联想之于全球AI生态链的价值则更为稀缺。从2024年Tech World 开始,英伟达、AMD、英特尔、Meta、微软、高通等公司掌门人,就共同出现在联想的AI叙事中。这些公司分处芯片、操作系统、云、模型、社交平台和终端生态的关键位置,彼此之间既合作也竞争。它们愿意在同一场大会中出现,早已说明联想集团在AI产业链中的核心地位:AI技术的落地者和商业变现者。

全球供应链,是联想集团在物理世界的底座。就在世界杯期间,Gartner Top 25公布其2026年最新排名,联想集团首次进入全球前五,刷新历史记录。联想在全球10余个市场拥有30多个自营或合作制造基地、2000多家一级供应商,每年处理超过1000万条订单线。这是联想集团能够穿越地缘政治、存储涨价等周期的护城河。AI时代的联想供应链也在演进:不仅提升自身风险预警与动态调度产能的效率,更将这种智能协同能力开放给了其庞大的上下游生态伙伴。

“AI普惠的时代机遇,不属于任何一家企业,而是整个生态的共同机遇”,联想集团董事长兼CEO杨元庆表示,联想集团的AI新十年,绝非独行的旅途,而是生态共赢之路。

从收购IBM全球PC业务,到连续多年拿下Gartner全球供应链Top 25亚太第一,再到在Tech World上将AI巨头全部请上同一个舞台,联想集团从未试图在每一个时代的单一技术点上“赢者通吃”,它更擅长另一件事:形成一套稳定、普惠的社会生产力,成为那个让各方都无法绕过的连接者。

如果所有变量都能被算法穷尽,竞技会失去魅力,商业也会失去价值——不可被预测的世界才迷人。而在充满不确定性的真实世界,才更需要说到做到的连接者。