先看四个字:"舞""無""又""有",中国人闭着眼都认得。可要是把这四个字扔到日本人面前,他们会读成"マイ・ナイ・ユウ・アル"(mai nai yuu aru),跟汉语发音半毛钱关系都没有。

为什么?这事得从甲骨文说起。

打开网易新闻 查看精彩图片

你有没有发现,"舞"和"無"读音挺像,偏旁也相似;"又"和"有"也是一样。这不是巧合。在甲骨文里,"舞"和"無"本来就是同一个字——画的是一个小人张开两手跳大神。

古人最早只画了这个"跳舞"的符号来表示"舞",后来发现嘴里讲"没有"的那个词和"舞"谐音,而"没有"这种概念本身画不出来,怎么办?直接把"舞"借过来用。时间一长怕混淆,就在原字下面加了两个小角,才有了今天的"舞"字。

"又"和"有"也是同一个套路。最早的甲骨文都写成一只右手的样子,本来表示"右"。因为"有"和"右"谐音,就把"右"借来表示"有"。到了西周,才给两个字分别加偏旁区分开,一个加矿块,一个加肉。

打开网易新闻 查看精彩图片

战国以后字形翻转,就定型成今天的"右"和"有"。这种"假借字"在《说文解字》里被列为"造字六书"之一,是汉字最早的表音思想萌芽。

但到了日语里,这四个字读成"マイ・ナイ・ユウ・アル",和汉语完全脱钩。因为日语源头上就不是汉语,它是硬拿自己的发音去套汉字。更麻烦的是日语是多音节语言,一个"有"在不同时态下要变成"ある、あり、あった"一串尾巴。

光靠一个"有"字根本写不出来。日本人最后找了一百来个汉字专门拿来拼音,再把这些字的草书偏旁抽象改造,就成了假名——"假借语言表音之名"。

打开网易新闻 查看精彩图片

说到汉字这事,有个绕不开的人物。一个叫理查德·西尔斯的美国老头,花了半辈子把九万六千多个古代汉字字形一个一个录进电脑,中国网友管他叫汉字叔叔。他在南京设了工作室,用动画、增强现实和人工智能做短视频讲汉字故事。

2025年底一场国际语言文化研讨会上,他用那口怪腔怪调的中文抛出一句话:"汉字,是全球唯一超越时空的文字。"

其实西尔斯讲的事,底层逻辑非常简单:语言和文字是两回事。语言人人都有,文字是少部分精英发明出来的记录工具。记录可以用表音符号,也可以用表意符号。咱们常说"语文语文",但如果不把"语"和"文"分开看,就会搞出一堆乌龙。

打开网易新闻 查看精彩图片

举个例子——"东干文"。清末一批陕甘回族跑到中亚,用俄文字母拼自己的西北方言,写出来谁都看不懂,可念出来还是地道的陕甘话。

再翻一张十块人民币,背面有一行"Cuengzgoz Yinzminz Yinzhangz",这是壮语的"中国人民银行 十元",其中"人民银行"几个字直接借的是北方汉语发音。

再看印度印地语和巴基斯坦乌尔都语说同一句"这里真干净",念出来几乎一模一样,可一个用天城文字母写,一个用波斯字母写,看上去完全是两种语言。

打开网易新闻 查看精彩图片

印度和伊朗这些语言,和欧洲各种语言其实同属印欧语系。

数一下"1、2、3":伊朗语yek do se,印度语ek do teen,古希腊语heis duo treis,俄语odin dva tri,意大利语uno due tre,一听就是亲戚。但字母选择五花八门。甚至波斯语自己都有两套写法,伊朗用阿拉伯字母,塔吉克斯坦用俄文字母。

蒙古语也一样,外蒙用俄文字母拼"乌兰巴托",内蒙用传统蒙文竖着写"乌兰巴托",念出来都是Ulaanbaatar,而传统蒙文本身也是拼音——还是成吉思汗找了一个叫塔塔统阿的维吾尔人,用回鹘文字母搞出来的。

这条字母血脉往上追,回鹘文来自粟特文,粟特文来自叙利亚字母,叙利亚字母、阿拉伯字母、希伯来字母又同源于巴勒斯坦的迦南字母。

打开网易新闻 查看精彩图片

迦南字母怎么来的?当地人把牛头叫Alpha,房子叫Beta,长矛叫Gamma,鱼叫Delta。

他们直接把这些符号的首音抽出来当字母用,拼成a、ba、ga、da。希腊字母的Alpha Beta Gamma,拉丁字母的abcd,走的都是这个路子——跟汉字的"假借"思路惊人地像,只是走得更彻底。

再往上还有埃及象形文字。别看它石碑画得像小人书,本质也是拼音。古埃及人把眼镜蛇叫Visi,就画条蛇;嘴叫La,就画张嘴。碰上第三人称后缀"f"这种虚词,画不出来,就直接拿那条"Visi蛇"代表"f"的发音。

于是整部古埃及文字就变成了一套固定的拼音字母,图像只是外壳。

打开网易新闻 查看精彩图片

这么一路看下来,从楔形文字到埃及文,到迦南、希腊、拉丁、阿拉伯、蒙古、回鹘,再到印度梵文、藏文——全世界主流文字几乎都是拼音。藏文乍一看跟汉字八竿子打不着,但藏语其实属于汉藏语系。

藏语数一二三四五念Chik Nis Song……,而上古汉语的一二三四五本来读Glits Nis Sohn Glits……,和藏语亲得不得了。只是藏文用了拼音,看上去就彻底成了陌生面孔。

汉字这条表意路线到底带来了什么?联合国有六种官方语言,同一份《联合国宪章》翻成六个版本,厚薄差距大到离谱。中文版两万六千多字,英文版五万五千多字,法文、俄文、西班牙文都在五六万字左右,阿拉伯文也超过四万字。

词汇量更夸张——中文版只用了四百多个不同的词,英文版九千多个,法文接近一万,西班牙文破万。语言学上有个指标叫"信息熵",汉字单字平均信息熵高达9.6比特,英语字母大约4比特。一个汉字顶两个多英文字母的信息量,这事实打实。

打开网易新闻 查看精彩图片

汉字为什么没有像全世界主流文字那样彻底变成拼音?第一条,几千年语言演变,汉语音系大幅简化,复辅音、辅音韵尾大量退化,同音字一堆。但只要有汉字,"诗、师、狮、湿""计、记、季、既、寄"照样分得清。

要是像日本那样全靠假名,"校内写生"和"口内射精"都写成同一串"こうないしゃせい"——这就要命了。近代引入新词,一个"氦"字加个偏旁就搞定,日语只能硬拼成一长串片假名,看了眼花缭乱。

第二条,中国是原生而且早熟的文明。我们不需要像欧洲、中亚、蒙古那些次生文明一样,借隔壁大哥的字母来拼自己的话;也不像日本、英国那样,稍微高级一点的词就得向外借。

日语的"心"叫こころ,可英语的"心的"叫cardiac,是从希腊语借的。几千年文化连续、政治长期统一,老祖宗传下的高级词汇,加上今天蹦出来的新概念,都可以用汉字自由重组。

打开网易新闻 查看精彩图片

西尔斯讲过一个很形象的例子:英语里牛是cow,牛肉是beef,羊肉是mutton,猪肉是pork,四个毫不相干的词要一个一个背;中国人认识"牛""羊""猪""肉"四个字就够了,排列组合通吃。

《牛津英语大词典》收录四十多万个单词,每年还在膨胀;《新华字典》常用字才三千五百个,掌握这些就能读懂百分之九十八的书面材料。汉字就是一套天生的"信息压缩包"。

第三条,汉语本身是单音节结构,词汇和语法靠排列重组,和方块汉字的形态高度适配。谐音假借加形声造字,就足够应付。而印欧语、日韩语、蒙古突厥语都是多音节、后缀复杂的语言,不走拼音路线根本没法玩。

汉字还有一个外人很难想象的本事——穿越时空。西尔斯在研讨会上拿出一块甲骨拓片,刻着"癸卯卜,今日雨",台下一个中国观众张口就译:"癸卯日占卜,今天会下雨。"没查字典,没翻译。

打开网易新闻 查看精彩图片

他又拿出古英语史诗《贝奥武夫》的八到十世纪手稿问英国人谁能直接读,全场沉默。连四百年前的莎士比亚,今天的美国高中生都要靠大量注释才能啃下来。古巴比伦楔形文字、古埃及象形文字早断了香火,只有汉字一路活到今天。

当然汉字也有代价,就是学起来门槛高。而且中国人有个本能——因为字形有意思,我们往往太在意字面写的是什么,反而忽略了背后的音。这让我想起一件事:巴基斯坦为什么叫"乌尔都语"?

因为那一带曾被突厥人占领过,突厥语"帐篷"叫Ordu,所以乌尔都语的字面意思是"帐篷语言"。

这个Ordu在蒙古语里也在,咱们翻成"斡鲁朵""斡尔朵",还有一个附属词叫Ordus,内蒙那座城市鄂尔多斯就是这么来的,意思是"一堆蒙古包"。

打开网易新闻 查看精彩图片

到了AI时代,汉字这套底层设计反而被成倍放大。

2025年初DeepSeek横空出世,V3模型在多项第三方评测中追平甚至超过海外主流模型,训练成本却低得多。

中文语料信息密度高、冗余度低的天然属性,正是它能以极低成本跑出顶尖性能的关键之一。斯坦福《2026年人工智能指数报告》显示,截至2026年3月,美国的领先优势仅剩2.7%。

与此同时全球中文学习者累计超过2亿人,中文已被86个国家纳入国民教育体系,中国空间站的操作界面全部使用中文,欧洲航天员为了有朝一日登上中国空间站,早就开始拼命学中文。

打开网易新闻 查看精彩图片

相比之下,拼音文字乱借外来词才是真灾难。我至今还记得在日本学建筑时碰到的一个日语词"プレストレスト・コンクリート",查半天才明白,就是把英文Prestressed Concrete硬拼成假名——"预应力混凝土"。

一个本来三个汉字能讲清的概念,变成一长串看了想哭的片假名。

回头再想西尔斯那句"汉字超越时空",不是文化自嗨,是从甲骨文到DeepSeek,这套五千年前写好的底层代码,内核一个字没改。