文|刘澜昌
9月18日,英国媒体人皮尔斯·摩根主持的《Piers Morgan Uncensored》节目出现了一个意外场面。由英国Particle6旗下AI团队开发的虚拟演员提丽·诺伍德,在与真人演员汤姆·康蒂讨论电影《Misaligned》时,原本一直使用英语回答,却突然切换成粤语,持续十几秒后又恢复英语。摩根当场追问原因,这段视频随后迅速传播,截至9月19日已有超过1200万次观看。
如果只把它看成一次技术故障,这件事其实没有多少值得讨论的地方。真正值得追问的是:一个被英国公司制造、在英语环境中运行的AI角色,为什么会在毫无预告的情况下跳入中文语境?这究竟是偶然的语言“串线”,还是大模型内部复杂语言结构的一次意外暴露?
Particle6给出的解释并不一致。公司方面后来表示,诺伍德并非简单发生故障,甚至暗示它可能是在展示自己的多语言能力;公司官方账号随后也称,这个虚拟演员能够使用30多种语言。但在节目现场,诺伍德自己却把这次情况解释成“线路串了”式的小故障。究竟哪一种说法更接近真实原因,目前没有足够证据下定论。但恰恰因为原因没有被完全解释清楚,这一幕才有研究价值。
大模型并不是一本把不同语言整齐分门别类的词典。它在训练过程中吸收的是海量文本、代码、图片说明、对话和知识之间复杂的统计关系。不同语言并非彼此隔绝,而是在模型内部形成相互连接的表示空间。一个模型表面上可以用英语回答,内部处理信息时却未必只沿着英语路径运行。
近年的研究已经发现了这种现象。2025年的一项研究考察了多语言大模型的内部语言表示,发现不同模型在处理跨语言任务时,会表现出不同的“枢纽语言”倾向。另一项针对大型推理模型的研究则直接提出“推理枢纽语言”概念:在多种输入语言环境下,模型的长链条推理往往会偏向英语或中文,而最终输出仍可以重新切换到用户使用的语言。
因此,把诺伍德突然说粤语简单解释为“训练数据里有中文”,当然过于粗糙。语言切换涉及模型架构、训练数据比例、上下文、提示词、推理过程以及实时语音系统等多个环节。尤其是粤语与普通话并不是同一种语言形式,能够在实时互动中突然切换,更不能仅凭这一段视频就证明某一种训练机制。
原因并不复杂。中文互联网拥有规模庞大的文本资料、百科内容、技术讨论、代码社区、学术资料以及商业信息。与此同时,中国又是全球AI应用和数字内容生产规模最大的市场之一。大量中文信息并不会因为模型开发者位于英语国家,就自动消失在训练体系之外。只要数据进入公开网络,只要它具有信息价值,就可能成为模型学习世界的一部分。
更重要的是,中文的价值正在从“可翻译的语言”变成“可参与推理的语言”。相关研究发现,在部分大型推理模型中,中文甚至能够成为内部推理的主要语言之一。研究人员在多语言测试中观察到,模型可能接受日语、韩语、西班牙语等输入,却在内部转向英语或中文完成部分推理,然后再返回原来的语言输出。
互联网时代,语言影响力通常取决于谁拥有更多读者、更多出版物、更多媒体渠道;AI时代则多了一层:谁拥有更多能够被机器学习、验证、调用和重组的高质量知识,谁就可能在模型内部留下更深的痕迹。
这并不意味着中文将取代英语,更不意味着某次AI说中文就可以被包装成所谓“技术胜利”。真正值得关注的是,AI正在把不同文明、不同语言体系积累的知识重新混合。模型并不天然接受人为划定的语言边界,也不会因为开发者来自哪个国家,就自动按照地缘政治划分知识来源。
如果各国都希望拥有自己的AI生态,数据、模型、芯片和算力当然可以形成不同体系;但如果进一步试图把知识本身切割成互不往来的信息孤岛,问题就会变得复杂。模型越强,对多语言知识的需求越高;知识越丰富,跨语言之间的关联也越重要。人为筑起的技术边界,未必能够阻断信息本身的流动。
当然,开放并不意味着毫无边界。训练数据涉及版权、隐私、错误信息、偏见以及知识产权,跨境数据使用同样需要明确规则。真正成熟的AI治理,不应建立在“谁的数据都可以拿来用”之上,也不应建立在“只允许某一种语言进入模型”之上,而应当建立透明、可追溯、可授权、可审查的规则。
一个英国AI演员突然说出粤语,当然不能证明什么宏大的结论。但它至少提醒人们,AI正在形成一种过去没有出现过的全球知识结构。在这个结构里,语言不再只是交流工具,也是数据、知识和推理能力的载体。未来真正值得竞争的,或许不是哪一种语言能够把其他语言挡在门外,而是哪一个社会能够持续产生高质量知识,又能够让这些知识被世界理解、验证和使用。
热门跟贴