一家深藏幕后的图书数据公司,正悄然为AI行业搭建一条通往“洁净数据”的秘密管道。这个本为图书馆和书商服务的市场,如今成了大模型训练的原料供应方。ISBNdb,这家自称拥有全球最大图书数据库的公司,公开表示可以帮AI企业大量采购实体书,规模从1000本到100万本不等。其货源来自二手市场,那里汇聚着图书馆、零售商和个人转让的旧书。
它的推销逻辑直白而犀利:旧书能提供更干净的数据。该公司在官网上写道:“全世界最好的AI训练数据就摆在书架上。书籍代表着经过策划、同行评议的特定领域人类知识,其结构化程度是任何网络爬虫都无法复制的。它们是高密度、经过编辑且权威的资料。”在他们眼中,这些布满灰尘的旧纸堆,或许是AI进化的完美食粮。
采购重点几乎全部锁定在2022年之前出版的书籍。这个时间节点之所以关键,是因为在此之后,由AI生成的合成文本开始在互联网上大规模扩散。一个被业界反复提及的棘手问题是,如果AI模型长期吞食自己产出的内容,其性能会逐渐衰减,这种现象通常被称为“模型崩溃”。ISBNdb将纸质书包装成了规避这一风险的护身符。他们宣称:“来自大语言模型时代之前的印刷书籍,在结构上保证了不受这种污染。在此日期(2022年之前)出版的实体书,结构上不受现代污染工具的影响。”
为了让这种大规模采购具备可操作性,ISBNdb将自己的书目数据与采购服务整合在一起,以此帮助买家避免重复购买同一本书,并组装出庞大且多样化的数据集。同时,整个交易过程对保密性的强调达到了近乎苛刻的地步。该公司的网站明确声明,每一笔合作都受一份严格的保密协议约束,买家的身份、策略以及具体的采购目标,都会被彻底隐藏起来。外界无从知晓,到底是哪些公司在为自家模型疯狂储备原料。
这种不透明性同样笼罩着上游的图书供应商。在Alibris和Biblio等在线书市上,不少卖家都提到,最近几个月大额订单的数量急剧攀升,但买家的身份却始终是个谜。一位专营外文图书的卖家表示,从今年四月起,销售状况发生了翻天覆地的变化。他在接受科技媒体404 Media采访时坦言:“我个人对这个事情的感受非常复杂。一方面,它确实让我赚到了钱,还能帮我清掉那些本来卖不掉的老库存。我手头那些来自海外的外文书尤其适合做这类生意。但另一方面,我真的不喜欢这些书的最终归宿,更不喜欢那些不常见的书就这样被打成了纸浆。”
这些订单本身也透着诡异。它们并不像大学图书馆采购那样聚焦于某个特定学科,而是天女散花般随机分布在各种主题和格式上。该卖家指出,这些订单之所以显得反常,不仅是因为量大,还因为它们看起来毫无章法,甚至完全无视正常的定价逻辑。他倾向于认为,从这种大手笔的花钱方式来看,采购模式非常像AI公司的操作。在Alibris的一个论坛上,另一位用户也发现了端倪:“是不是只有我一个人觉得,从去年年底开始,自动购买订单的数量就一下子多起来了?”面对这股汹涌而又沉默的扫货潮,旧书商的仓库正在被掏空,而无数实体书或许正在被拆解、扫描,最终在完成数据投喂的使命后,无声地化作碎片。
热门跟贴