你能想象吗?一家公司一次性下单购买一百万本实体书,目的不是为了阅读,而是把它们粉碎成数据。

这就是当下AI训练链条上一个隐秘的角落。ISBNdb——自称拥有全球最大书目的数据库——如今正帮助人工智能公司大规模采购二手实体书。这些书多数出版于2022年之前,恰恰因为那个时间点后,合成文本开始在网上泛滥。ISBNdb在公司官网上直言:“世界上最好的AI训练数据就搁在书架上。”

打开网易新闻 查看精彩图片

为什么实体旧书突然成了抢手货?答案藏在AI模型的一个著名陷阱里:模型崩溃(model collapse)。当训练数据中混入越来越多的AI生成内容,模型会逐渐变得同质化甚至退化,就像反复复印一份文件,越复印越模糊。而2022年前出版的纸质书,天然隔绝了这种风险。ISBNdb给出的说法是:“LLM时代之前的印刷书籍,在结构上保证不受这种污染。”换句话说,这些“预LLM时期”的旧书,等于自带纯净数据标志。

为了把实体书变成可用的训练原料,ISBNdb不仅提供包含上千万条书目的数据库,还配套了采购服务。买家只需提出需求,从1000册到100万册,ISBNdb就能从图书馆、零售商和个人的二手库存中协调调用。整个过程强调避免重复、确保数据集多样,而且极度保密。网站声明,所有交易都受严格的保密协议约束,买家的身份、策略和采购目标一概不公开。

这种不透明也延伸到上游的供书市场。在Alibris和Biblio这类二手书平台上,卖家们近几个月明显感到批量订单在激增,但订单背后的买家是谁,没人能辨认。一位专营外文书籍的卖家说,从今年4月开始,销售模式突然改变。这位卖家向404 Media描述了自己的复杂心情:“我个人对这件事感觉很复杂。一方面,这对我经济上有好处,还能清掉原本很难卖掉的旧库存。我的海外库存和外语书特别适合这种生意。但另一方面,我不喜欢这些书的最终用途,也不喜欢一些不常见的书就这样被化成纸浆。”

更让卖家觉得匪夷所思的是订单的构成。它们不像图书馆采购那样集中在某个学科,而是横跨各种主题、版式和语言领域。这位卖家发现,订单不仅数量大,而且随机性极强,完全不遵循正常的定价规律,看起来就像是在用大笔资金扫货。另一位在Alibris论坛上发帖的用户也印证了这个趋势,他问:“是只有我这样觉得,还是去年年底以来AutoBuy的订单真的变多了?”

这些线索拼在一起,指向一个事实:对AI公司来说,旧书不只是历史文本,而是一座价值被低估的“清洁数据矿”。它们被大规模买走、切碎、扫描,转化成模型训练中的养分。但代价是,大量实体书就此消失,其中不乏冷门、稀有的版本。旧书店老板的账本上看得到利润,却看不到那些书最终去了哪里,又怎样被“消化”掉。

当一个行业把印刷文明最后的实物形态当作数据原料来收割,它收获的究竟是更聪明的模型,还是人类知识遗产的另一种消解?