#AI 公司被曝大量收购旧书

多家媒体调查曝光,全球多家头部 AI 企业正在通过中间商大批量收购二手旧书,重点瞄准 2022 年之前出版的纸质图书。书籍完成高速数字化扫描提取文本之后,大量原版实体图书直接粉碎销毁。很多人不解,AI 训练依靠网络数据就足够,为什么企业不惜重金到处扫货旧书,这场席卷图书市场的抢书潮,藏着大模型发展最关键的数据博弈。

打开网易新闻 查看精彩图片

核心原因在于互联网数据正在持续 “被 AI 污染”。自从生成式 AI 普及之后,全网充斥大量 AI 自动生成的文章、评论、文案。如果大模型持续使用掺杂 AI 产出内容的数据训练,会出现 “模型坍塌” 现象,输出内容越来越空洞、逻辑混乱、缺乏原创能力。而 2022 年之前出版的纸质书籍,全部由人类原创撰写,经过专业编辑校对,是现存稀缺的纯净训练语料。

对比网络碎片化文本,书籍拥有完整的知识体系、连贯长文本、严谨叙事逻辑,涵盖历史、文学、理工专业知识,能够有效提升大模型长文本写作、逻辑推理能力。公开网络爬虫获取内容还容易卷入版权纠纷,而海外部分司法判例认定,企业合法购入纸质图书、内部扫描训练模型,更容易被认定为合理使用,一定程度规避版权诉讼风险。

打开网易新闻 查看精彩图片

让人惋惜的是,为了防止扫描文件二次传播,不少企业选择扫描完成后销毁原版书籍。部分绝版古籍、小众专业史料,存量十分稀少,一旦被批量收购销毁,纸质原件永久消失,只留存数字化版本,对于文化保存而言是巨大损失。消息曝光之后,马斯克公开表态,要求旗下 AI 团队采用无损扫描方式,保留原版图书,拒绝破坏性切割扫描。

随着这场数据竞争持续发酵,二手图书市场已经出现明显变化。冷门专业书籍、早年学术著作订单暴涨,收购方通常不议价、不问成色,大批量下单。旧书商根本想不到,原本日渐萧条的二手图书,如今成为 AI 巨头争夺的战略资源。未来优质人类原创语料,将会成为各大 AI 企业构筑壁垒的核心资产。

打开网易新闻 查看精彩图片

很多普通读者尚未意识到,数据资源争夺战早已超越算力比拼。算力可以持续扩充,纯净、未被污染的人类文本资源不可再生。当优质原始语料越来越稀缺,谁掌握更多高质量数据,谁的大模型就能持续保持创造力,拉开和竞品之间的差距。

这场旧书收购浪潮,也给整个行业敲响警钟。如何平衡 AI 技术发展与纸质文献保护、厘清图书数字化版权边界,是全球亟待解决的难题。技术向前发展,不能以实体文化载体消亡作为代价。你如何看待 AI 企业大批量收购、扫描并且销毁旧书这件事?