中国的人工智能(AI)开发正面临一个新的瓶颈:高质量中文训练数据不足。尽管美国对先进AI芯片的出口管制长期被视为主要制约因素,但多位中国AI专家日前警告,中文语料的稀缺可能成为下一个“卡脖子”问题。 AI模型的性能高度依赖海量高质量训练数据。研究机构Epoch AI估计,人类公开发布的文章经过去重和质量调整后,约有300万亿词元;按当前训练消耗趋势,语言模型可能在2026年至2032年间用尽这些数据。这一挑战并非中国独有,但中文数据匮乏表现得尤为突出。 据网站技术调查机构W3Techs统计,截至2026年8月10日,全球可识别语言的网站中,中文网站仅占1.3%,而英语网站高达49.5%,日语网站占5.0%。清华大学教授孙茂松与学者孔存良在《光明日报》撰文指出,中国面向大语言模型的语料库建设仍处于早期阶段;网络存档Common Crawl中的中文数据占比仅约4.8%,且中文百科、科学著作、学术期刊、词典等知识密度较高的语料严重不足。 为扩大中文数据供给,孙茂松等建议加快出版物、古籍、地方志、历史资料的数字化,并将词典、影像、方言和少数民族语言纳入语料库。他们同时强调,需要建立完善的版权授权机制。目前已有出版机构明确抵制将书籍用于AI训练,例如华夏出版社就禁止其图书被用于AI模型训练。 在政策层面,中国政府正在推进AI数据基础设施建设。国家数据局2026年6月8日宣布,计划到2028年底在科学研究、工业制造、医疗卫生等领域建成一批经过实际应用验证的高质量数据集;对难以采集的数据,将采用仿真和合成技术加以补足。 中国信息通信研究院院长余晓晖在国家数据局官网撰文表示,AI时代的竞争不仅是模型和算力的竞争,更是高质量数据供给体系的竞争。谁能率先建成集数据生成、管理、流通、利用和价值创造于一体的机制,谁就有望在下一阶段赢得先机。对中国AI而言,如何突破中文数据瓶颈,将决定这场竞赛的真正走向。

打开网易新闻 查看精彩图片