近期多家海外媒体调查曝光,不少头部AI企业通过中间商,在二手图书市场批量扫货旧书,订单动辄数千甚至数十万册,重点瞄准2022年之前出版的纸质读物。这批图书经切割扫描提取文本,用于大模型训练,扫描完成后大量实体书籍直接销毁。这场悄然兴起的“抢书潮”,揭开了大模型数据竞争背后的复杂博弈。

打开网易新闻 查看精彩图片

AI企业疯狂收购旧书,核心诉求是寻找“纯净训练数据”。如今互联网充斥海量AI生成内容,若持续用这类文本训练模型,容易引发“模型坍塌”,造成输出逻辑混乱、创造力下滑。而AI普及浪潮之前印刷的旧书,内容全部来自人类原创,经过编辑校对,行文严谨、知识体系完整,不存在AI生成文本污染,成为稀缺的数据资源。对比网络抓取内容,书籍包含专业理论、文学叙事、历史资料,能够显著提升大模型逻辑、长文本表达能力。

除此之外,这套模式暗藏法律层面的考量。此前多家AI厂商因抓取网络盗版电子书卷入巨额版权诉讼。按照海外部分现有判例,企业合法购买纸质图书,扫描用于模型内部训练,更容易被认定为“合理使用”。相比直接下载盗版电子文本,批量采购实体旧书,可以规避一部分侵权风险。但为防止扫描后的内容再度流转,不少企业选择扫描结束后销毁原版书籍。

此举引发文史界、书商强烈争议。部分订单包含绝版读物、小众史料,一旦扫描销毁,独一无二的纸质版本永久消失。数字化文本无法复刻原书批注、装帧、版本信息,很多历史文献价值被简单简化为文字素材。不少藏书爱好者直言,这是数字时代新式“焚书”。马斯克也公开表态,要求旗下AI团队采用无损扫描,反对切割销毁珍稀图书。

争议的核心矛盾,在于技术发展与文化传承、创作者权益之间的失衡。大模型离不开海量文本素材,但不能以损耗人类文化遗产为代价。当前全球关于AI训练使用出版物的版权规则尚未统一,作家、出版社难以获得合理收益。单纯依靠收购旧书扫描,游走在版权灰色地带,长远不利于内容产业良性循环。

面向未来,AI行业需要建立可持续的数据合作机制。AI企业应当主动和出版社、创作者达成正版授权合作,优先采用无损数字化方案,妥善保存有史料价值的典籍。监管层面也需要加快完善法规,厘清AI训练内容使用边界,平衡人工智能创新与版权保护、文化保存。技术发展的终极目标是传承文明,而非消耗文明。