最近有个观点在网上吵翻了天:美国AI要是继续抱着英语训练,恐怕永远追不上中国模型。这话乍一听像喊口号,可你要是掰开揉碎了看数据,会发现事情没那么简单。

打开网易新闻 查看精彩图片

先从一个反常识的事实说起。很多人以为大模型跟人一样在“读懂”语言,其实它干的事相当机械——把文字变成数字,在海量语料里统计哪些字词更容易挨在一起,然后按概率往外吐字。既然玩的是概率游戏,那喂给它的语言本身够不够精炼,就直接决定了账单有多长。

打开网易新闻 查看精彩图片

咱们算笔账。中文常用字也就三千五百个上下,掌握了它们,绝大多数文章、甚至不少专业材料都能啃下来。英语呢?日常聊天两千词凑合,想顺畅读报得八千到一万二打底,钻进专业领域两三万词都打不住。牛津词典收录的单词已经奔着六十万去了,还源源不断冒新词。英语圈碰到新概念就爱造新词,什么量子计算、凝聚态物理,一个领域一串生面孔,每个都得让模型从零学起,单独占一块记忆空间。

打开网易新闻 查看精彩图片

中文的路数完全两样。字还是那些字,换着花样组合就行。“量”“子”“计”“算”四个字模型早就滚瓜烂熟,碰到“量子计算”这个词,无非学一下这个新搭配而已。字库不用扩容,整个语言系统稳如老狗。这就好比搭积木,一边是每换一次图纸就重买一箱新零件,一边是同一盒积木拼出千变万化的造型,成本差在起跑线上就拉开了。

打开网易新闻 查看精彩图片

.语法也是一笔隐藏的开销。英语十六种时态,单复数、被动语态、从句套从句,一句话能长出好几层枝杈。模型解析这些结构,每一个层次都是白花花的算力。中文讲究意合,很多东西靠语境心领神会。举个最简单的例子:尘肺病、肺结核、肺气肿,你哪怕对医学一窍不通,看见一个“肺”字也能猜个八九不离十。换成英文的pneumoconiosis、tuberculosis、emphysema,全是从拉丁词根里拼出来的怪物,模型只能一个一个硬记。这不是玄学,是实打实的效率差距。

打开网易新闻 查看精彩图片

再看信息熵。香农把物理学里的熵搬进信息论,人类头一回能量化比较语言的浓缩程度。联合国几大工作语言里,法语大约3.98比特,西班牙语4.01,英语4.03,俄语4.35,中文直接飙到9.65,比人家高出一倍还多。联合国同一份文件,中文版厚度常常不到英文一半,道理就在这儿。

打开网易新闻 查看精彩图片

有意思的是,这个优势当年还被当成包袱。上世纪三十年代汉字拉丁化运动闹得沸沸扬扬,九十年代末《光明日报》还登过一篇讲汉语信息熵劣势的文章,说汉字太占字节,怕拖信息化的后腿。七十年代末苹果电脑风头正劲,国内不少人唉声叹气,担心汉字迈不过计算机这道坎。结果呢?王选埋头苦干十五年,搞出激光照排,打通了印刷关;王永民揣着南阳科委资助的三千块钱,鼓捣出五笔输入法;朱守拓的智能ABC,让不会拆字的人也能噼里啪啦打汉字。三座大山就这么被搬走了。当年差点被扔进历史的汉字,如今摇身一变成了AI时代的宝贝,真可谓三十年河东三十年河西。

打开网易新闻 查看精彩图片

成本数据更能说明问题。据一些报告估算,GPT4训练花费约七千八百万美元,谷歌Gemini Ultra的算力开销高达一亿九千一百万,DeepSeek传出来的训练成本才五百五十万美元左右,几乎是零头。可这个“零头”在实际体验里并不拉胯,不少场景甚至后来居上。省钱省在哪儿?语言本身的精炼功不可没。

打开网易新闻 查看精彩图片

还有个细节让西方技术圈脊背发凉。有位AI创业公司在实验里发现,DeepSeek不光聊孔孟老庄时碾压对手,讲黑格尔这种纯西方哲学,英文输出的深度和条理居然也胜过他们手上所有的英语模型。评论区不少人晒出实测,结论差不多。这就怪了——讲黑格尔不该是英语模型的看家本领吗?一种解释是算法领先太多,另一种解释是,中文里“阴阳”“矛盾统一”“中庸之道”这些词天生自带整体观和辩证观,模型吃透了这套框架,理解“正反合”“否定之否定”反而如鱼得水。说白了,人家手里有现成的高维地图,你还在拿线性思维一条道走到黑。

打开网易新闻 查看精彩图片

别忘了一个默默无闻的大功臣:咱们每个普通网友。十几年下来,贴吧的长帖、天涯的争论、微博的碎碎念、公众号的深度文、短视频里的烟火日常,堆成了全球独一份的中文语料富矿。段子也好,职场辛酸也好,家长里短也好,在模型眼里全是鲜活的人间样本。为啥你问英语模型中国的人情世故,它答得文绉绉、客气得像教科书?因为它没吃过那些真实场景的“细糠”。从这个角度讲,每个在网上吐槽、分享、记录的人,都在给这个时代的AI做标注。

打开网易新闻 查看精彩图片

那有人要问了:美国公司往模型里加中文训练不就完了?事情没这么容易。在英文底座上打中文补丁,跟用中文当根基重新造,完全两码事。现有模型的分词方式、语义空间、训练策略,全是围着拼音文字的特点量身定制的。要真改成中文底层,等于亲手宣判过去那套是半成品,砸进去的几百亿美金怎么交代?对OpenAI、谷歌这样的巨头来说,这不是一道技术题,是一道要命的财务题。而国产模型反着来:中文是心脏,英语是外挂,轻装上阵。

打开网易新闻 查看精彩图片

当然,话说回来,英语不至于出局。科研论文、工程标准、国际交流这些领域,它短期内的地位撼动不了,代码语料和英文文献的积累也是真金白银。更可能的未来是,顶级通用模型的内核用中文搭建认知框架,外面再兼容英语、法语、西班牙语当接口,跟鸿蒙的思路有点像——内核是自己的,生态照样通吃。

打开网易新闻 查看精彩图片

所以对美国AI来说,真正的天花板未必是芯片,可能是他们死死不放的那门语言。当年被骂作信息化绊脚石的汉字,如今扛起了效率大旗,这剧本谁能想到?

打开网易新闻 查看精彩图片

留三个问题给你琢磨:未来十年,中文会不会坐上全球AI底层语言的头把交椅?你日常用国产模型和海外模型,哪个更对胃口?哪天美国巨头宣布主干训练改用中文,你会当成营销噱头,还是大势已定?评论区聊聊,看看大家的直觉跟数据对不对得上。