乌干达一位妈妈,用自己家乡的方言,问 AI 一个关于孩子健康的问题。
然后她得到了准确的回答。
这听起来没啥稀奇对吧,反正 AI 不就是拿来问问题的。
但你知道吗,如果她用的是 OpenAI 的 ChatGPT,大概率得不到这个答案。不是答案错了,是她的语言,可能根本不在人家的重点照顾名单里。
乌干达这个国家,人口 4600 万,说的语言超过 50 种。放在西方大模型眼里,这种市场太小了,语言太碎了,不值得为它专门优化。
乌干达城市街道
但中国的开源模型 Qwen3 去了。它支持 119 种语言,包括爪哇语、宿务语、海地克里奥尔语这种「小到不能再小」的语言。乌干达的 ICT 部门亲自下场背书,说「技术要让每个公民不分语言、不分地点都用得上」。
朋友们,这就是我今天想聊的事。
硅谷 AI 死死守着自己的英语世界
而中国开源大模型,正在悄悄拿下所有他们说「不划算」的地方。
先别急着下结论,咱们先看看硅谷这边。
OpenAI 的 ChatGPT,从来没有官方公布过自己到底支持多少种语言。谷歌的 Gemini 说自己覆盖 70 多种,Anthropic 的 Claude 官方基准测试大概 15 种,xAI 的 Grok 语音 20 多种。
听起来好像也不少。但懂行的都知道,覆盖是一回事,质量是另一回事。一个模型说「支持」某种语言,跟它能把这种语言说得地道、接得住当地的文化梗、不瞎编,中间隔着十万八千里。
你看 OpenAI 也好,谷歌也好,训练重心在哪?欧美,英语。产品定位在哪?欧美,英语。商业模型在哪?还是欧美,英语。
这没什么可指责的,人家是企业,要赚钱,英语市场最肥,先吃最肥的,天经地义。
但问题是,世界不是只有英语。
我给你一个数字,2024 年全球网民超过 68 亿,其中英语网民大约 11.86 亿,只占 15.79%。同期中文网民占比 17.41%,已经反超英语,成为全球第一大网络语言。印地语也有 4.34%。
可你再看看网上的内容呢?英语内容长期占全网 50% 到 60%。
看懂这个错配没有。不到 16% 的人,生产了全世界超过一半的网页内容。剩下的 84% 的网民,说着中文、印地语、阿拉伯语、斯瓦希里语、爪哇语,他们在 AI 时代的声音,几乎是被忽略的。
这才是「数字鸿沟」的新版本。以前是没网,现在是有了网、有了 AI,但 AI 听不懂你说话。
中国AI在夹缝中突破
而中国开源模型,恰恰是在这条缝里钻了进去。
说到这,就不得不回到千问这块。
你猜千问的开源版本现在全球累计下载多少次了?超过 30 亿次。什么概念?同期超过了谷歌 Alphabet 和 Meta 的所有开源模型,全球下载量第一。
30 万个衍生模型,挂在全世界各地开发者的 GitHub 和 HuggingFace 上。光 HuggingFace 一个平台,Qwen 衍生模型就超过 15 万个,是第二名的 1.8 倍。2026 年前七个月,每天新增 180 到 210 个衍生模型。
有人可能说,下载量高不代表啥,那是虚的。但你想啊,30 万个衍生模型背后是 30 万次「有人真的拿它去改、去调、去落地」的动作。每一次衍生,都是一个真实的本地场景。
为什么全球开发者愿意拿 Qwen 当底座?因为它是开源的,因为它是开放的,因为它支持的语言够多,更因为它便宜。
空口无凭,咱们直接看几个真实的落地案例,一个比一个炸。
第一个,乌干达。
就是开头那位妈妈的故事。Qwen3 被部署到乌干达,服务 4600 万人口,50 多种语言。项目负责人 Dr. Zawedde 说得特别朴素,「目标是让姆巴拉拉的妈妈,能用自己方言问健康问题,并且得到准确指导」。
这个项目不是为了刷数据,是真把 AI 送进了那些以前没人服务的角落。
第二个,马来西亚。
马来西亚搞了个叫 NurAI 的东西,号称全球第一个符合伊斯兰教法的模型。底座是啥?DeepSeek。由东盟-中国 AI 实验室精调,支持马来语、印尼语、阿拉伯语和英语,首批覆盖马来西亚、印尼、文莱,3.4 亿人口。
你看这个细节没有。人家不是直接拿来就用,而是用自己的文化标准、宗教标准,把中国模型重新训练了一遍,变成「自己的模型」。这种「再创造」,恰恰是中国开源策略最高明的地方,你拿走的是代码,长出来的是当地的主权。
第三个,沙特。
2025 年,沙特阿美旗下的 Aramco Digital 把 DeepSeek 部署进了达曼数据中心。这笔合作背后是 149 亿美元的技术投资,其中 109 亿砸在 AI 基础设施上。数据中心拿到海湾地区第一个 Tier IV 认证,可用性 99.995%。
他们测出来的结果是,DeepSeek 的阿拉伯语 NLP 准确率 89%,比国际竞品高出了差不多 10 个百分点。
为什么沙特不选美国大模型?因为 78% 的中东企业都担心自己的数据被西方公司「云绑架」。数据用后绝不外迁,这是中国方案给的承诺。更别说 DeepSeek 的 App 上线 7 天下载破亿,日活一度冲到 3000 万,沙特人自己就爱用它。
第四个,东盟。
科大讯飞的 Spark 模型,支持 130 多种语言的语音识别和同声传译,还跟广西合作建了「东盟多语言大模型基地」,靠广西那一大票熟悉东盟小语种的人才和语料,直接扎根东南亚。
发现没有,这四个案例,没一个是英语国家。乌干达、马来西亚、沙特、东盟,全在非英语赛道。
硅谷为啥不去抢这些市场?
不是不想,是真的有结构性短板。
第一,商业逻辑锁死了它。
OpenAI 和谷歌靠什么赚钱?订阅费和广告。订阅费哪来的?英语国家的中产。人家把资源全押在最有付费能力的市场,小语种市场连广告都卖不出几块钱,算不过来账。
第二,闭源模式天然排他。
你拿不到它的代码,就永远只能「租用」它的模型。想自己微调一个符合本地宗教、文化、语法的版本?门都没有。这也意味着,数据永远在人家服务器上。
第三,也是最要命的,话语权。
当全世界的 AI 都在说英语、按英语的逻辑思考、用英语的价值观训练的时候,一个国家的语言和文化在 AI 里是失声的。这就是为什么现在全世界都在喊「主权 AI」,每个国家都想要自己的模型,而不是永远租别人的大脑。
中国开源模型干的,就是把这把钥匙交出去。你拿走代码,你训练自己的模型,你说你的语言,AI 里终于有了你的声音。
顺着这个逻辑再往前想一层。
很多人还在盯着中美 AI 谁强谁弱,还在数 OpenAI 跟 DeepSeek 的榜单差距。但我越来越觉得,这场竞争的主战场,根本不在中美英语的对决里。
全球 84% 的网民说英语以外的话,这 84% 才是决定未来 AI 世界版图的人。
谁能让斯瓦希里语、爪哇语、宿务语、阿拉伯语、泰语、印地语在 AI 里被好好地说出来,谁就掌握了未来十年最重要的用户基础。语言是文化的地基,也是市场的地基,更是话语权的地基。
硅谷现在死守的英语世界,是一个 15.79% 的世界。而中国开源模型正在深耕的,是剩下那 84%。
这盘棋,才刚刚开始。
说到这,讲句实在话。
我不否认硅谷在底层技术上依然很强,也不觉得中国已经赢了,这条路还长得很。但有一点是可以确定的,当硅谷盯着后视镜里的英语市场,中国开源模型已经把车开进了第三世界的语言赛道。
乌干达妈妈的那句方言提问,就是这场比赛最响亮的发令枪。
你觉得,下一个被中国开源模型「拿下」的语言,会是谁?评论区聊聊。
热门跟贴