飞象网讯 (孙迎新/文) 为什么一个能写出满分作文的AI,却无法准确预测一个滚落马路的皮球,后面有可能跟着一个慌慌张张来捡球的小孩?

这样的问题在以往我们会得到一个显而易见的结论,但现在,更让人关注的是背后的深层次原因,是什么导致会误判这个即将到来的惨剧?这也引发人们进一步的好奇与困惑,为什么在虚拟世界无所不能的模型,一旦进入物理世界就会笨到频频违反常识?

打开网易新闻 查看精彩图片

7月18日,在2026世界人工智能大会专题研讨会现场,这个问题,以及背后更深刻的原因,成为了全场关注的焦点。当CCF副理事长陈健将词元预测与物理模型预测,摆上同一个桌子进行对比时,也让这场题为“从词元预测到状态推演,共塑世界模型的AI范式跃迁”的研讨变得容易理解,也更为具象。

大家意识到,AI已经迫切需要一场从概率到因果的彻底革命。

在这场关于世界模型的高峰对话中,嘉宾们不仅感性地提出,AI也面临从文科生向理科生转型的踟蹰与迷茫,更为我们梳理出一个逻辑,AI即将迎来技术范式、计算架构与行业应用三大破局的关键时刻。

复旦大学特聘教授黄萱菁更是抛出一个既易懂又难懂的论断,“过去的语言模型是写作文的文科生,而未来的世界模型必须是通过IMO奥赛的理科生。”

从词元预测到世界理解:预测下一个词是否通向真实世界?

我们或许知道,基于Token预测的大语言模型,和基于状态推演的物理世界模型,它们存在一种本质上的区别:从概率到因果。这种差别也导致了,基于Token预测是一种可修正的概率,而基于状态推演,则是一种会累积的误差。

湖南大学副校长李肯立指出:“大语言模型利用低精度,通过多次的反复迭代之后,即便是有误差也是可以修正的,最后它的结果是准确的。但是到物理模型之后,精度就变得比较重要了,它在后面误差累积之后往往是难以被修正的。”

他认为从概率到因果是两者最根本的区别,并且这还意味着,语言模型可以通过上下文不断自我纠错,而物理世界模型一旦在初始环节出现偏差,这个偏差会随着推演过程被不断放大,最终导致完全错误的结果。

尽管存在误差修正与物理定律之间的冲突,现在两者也将在具身智能这个躯体上进行结合。陈健认为,通过词元预测的大模型和通过物理模型预测的传统高性能计算之间,也并非是简单的替代关系。他提出:“如果说这两个之间有关联性,那就是目前黄仁勋说的第三个算力最重要的领域,也就是具身智能。其实只有到了具身智能这个领域,才需要词元预测加物理模型预测。”

上海交通大学特聘教授马利庄认为,具身智能的发展趋势是从单纯的词元转向统一的表征,即人物行为、场景以及决策表征。他举例说明:“机器也要看到,从机器的第一视角,特别是具身智能的角度来说,要真正读懂这个世界之后,它就可以预测你的行为。比如你要喝水了,这个瓶子当中没水,它就马上给你倒水,这就是主动的。”

黄萱菁也认为,下一代AI系统将避免犯错并及时修正。她提出:“将来我们要预测下一个场景,这是Next State Prediction,是世界模型要做的事情。”她还强调了语言模型在其中的作用:“语言模型本身也是一个世界模型……语言模型能够提供对物理规则的约束、环境的约束,整个社会伦理的约束都可以用语言来表达。”

世界模型的技术突破:新架构、新范式与新流程

虽说从词源预测走向世界理解已成为大势所趋,但是要构建真正的世界模型,则需要在技术层面进行多方面的突破,这些技术上的突破,还要形成包括数据处理、智能体能力以及科学发现的闭环。

针对迭代闭环流程的重构,李肯立强调了流程的改变:“它生成一个符合物理定律的客观规律之后,它去验证;验证之后反过来我们有新的数据生成,又能够去做新的实验,形成一个不断迭代的螺旋上升的机制。”

根据陈健提出的Science for AI概念,即用高性能计算指导生成式AI符合物理规律,马利庄特别强调了自主智能体的重要性:“简单地做一个炒菜,或者是做一个家庭的服务……整个流程它是一个思维链的过程,这个地方还是比较难。”他提到智能体在金融投资和自动编程方面的应用潜力,认为“智能体写软件写得那么可靠、那么快速、来得精准”。

仅仅写软件还不够,科学数据的下一站就是假设验证闭环,黄萱菁认为,要为科学发现服务,模型需要“能够提出假设,能够去验证假设,能够去执行,能够根据反馈的结果去对我的假设进行闭环式的调整”。她指出了科学数据的特殊性:“这些所有的比如像科学的图片,它不是自然图片,它后面一定是符合自然物理学规律的。”

而从静态到动态的动力学建模,就是符合自然物理学规律的一种体现。思朗科技AI首席科学家任智祥指出,当前的模型,就比如AlphaFold多是静态的,而真实世界是动态的。

他认为:“为了想做这样的科学世界模型,其实一定是需要这样的动态数据的。”他还强调生成高质量动态科学数据的重要性,因为这是训练科学大模型的燃料。

未来预测:世界模型最先在哪些行业取得突破?

坦率地说,我们中的大部分人,在生活中大概率不会过多关注词元预测,还有世界模型这类纯理科的探讨,也并不介意AI到底是文科生还是理科生。我们更关心的或许是股市的涨跌、小孩的升学,甚至什么时候下雨、雨量有多大,貌似都比对词元以及世界模型的探讨要有热度。

但世界模型很快就会与大家的利益密切相关,从世界模型落地应用的具体场景和时间表来看,这个变化很快会来临。

科学界与智能体组织将最先感受到这个变化,李肯立预测:“世界模型最先应该能够使用是在我们科学界里面,比如说在化学、在生物方面。”同时他认为在应用层,智能体在“流程的组织上面”将扮演重要角色。

自动驾驶与具身智能也是最先能够感受到变化的领域,对此陈健观点明确:“具身智能,如果说世界模型的预测对整个人类的世界发生改变,显然应该在具身智能中,还有一个领域显而易见已经正在极高速增长,那就是自动驾驶。”

针对无人驾驶、自动编程与服务机器人,马利庄则预测了三个方向:从远景来看,是通用的科学智能基础,自动发现物理规律;而近期来看,“无人驾驶会很快落地。”

站在行业角度来看,智能体将深入各行各业,甚至就连自动编程都已深入到自媒体行业里,以及在不远的明天,“服务机器人能够走进千家万户,成为你我的伴侣”。

面对个人智能助理的普及,尤其是手机形态的个人助理,黄萱菁预测,未来两三年内,“我们每一个人都会拿出来一个智能化的手机。这个手机就相当于我们的个人助理,能够记住我们的言论、身份、偏好,能够在不同时间空间替我们预测,为我们服务。”

而这些智能服务,都将来源于AI基础设施,任智祥认为,智能时代的下一个爆发点就在“AI for Science”,这个转变过程关键就在于“怎么样搭建好AI for Science的基础设施。从硬件到软件,再到上面的AI。”