曾经日本古书店里最难卖的东西,最近突然成了爆款。
买家不专挑名家签名本,也不只找稀有初版。哲学、医学、法律、江户时代生活史、几十年前的政治书,都出现在往上订单里,最高的一家,一天就卖出约1000册。
更奇怪的是,尽管购买账号各不相同,收货地址却指向同一个物流中心。
闻讯赶来的日本媒体还查到一条大新闻,已经有超过50吨标为“日本书籍”的货物出口美国。
悬念只有一个:他们买的到底是书,还是书里的字?
一、谁会用这种方式买旧书?
一个真正想读书的人,通常知道自己要找什么。
研究者按作者和书目采购;收藏者在意版本、签名和品相;普通读者至少会围绕某个题材挑选。可现在日本古书店接到的这些订单,题材跨度大得让店主摸不着头脑。
哲学书和医学书一起买,江户文化和旧政治资料一同装箱。不同账号反复下单,包裹却被送往同一处。
这不太像一位读者在扩充书架,也不像收藏家在寻找珍本,看起来买家根本不是在挑“书”。
如果说只有几家店接到订单,还是小事。那50吨的出口记录,让事情一下子炸了。
一本书大概500克,50吨约相当于10万册,这早已经不是某一位收藏者能放进书房的概念了。
在日本记者的一番追查后,事情很快有了眉目:
这根本不是什么书虫在淘宝,而是一场跨国AI巨头发起的“纸质文明大清剿”。
为什么已经吞噬了海量网页的大模型,还要重新跑回现实世界“啃纸”?
二、互联网那么大,AI为什么还要找纸书?
对早期的大模型公司来说,互联网就是一间开着门的巨大自助餐厅。
新闻网站、论坛、公开论文、电子书和百科页面,能被程序成批抓取,再经过清洗,变成训练资料。
但网页多,不代表可用的人类知识就能无限增加。
随着AI生成内容滚滚进入互联网世界,新模型也越来越可能读到旧模型写出的文字。
按照目前大模型训练数据的消耗速度,互联网上积累的高质量人类文本数据——大约在数万亿至数十万亿 Token 之间——将在2026年前后彻底耗尽。
如果不补充数据源,AI“模型塌陷”已成必然——如果模型一代代无差别地学习前代模型的输出,原始资料里少见的细节会逐渐丢失。
就像拿复印件继续复印:每一代看起来仍是同一张纸,细线和浅色印记却可能慢慢消失。
最容易获取、质量较好、来源又清楚的人类文字,正在变得越来越难找。
于是原来一本无人问津的旧地方志,正重新焕发价值。
它的文字也许从未被上传;一本发行量很小的行业报告,可能记录着主流网页没有保留下来的细节。
过去,冷门意味着没有多少读者。对需要拓展资料来源的买家来说,冷门就也意味着机器尚未大规模读过。
AI没有让旧书突然变新,却让“未被数字化”成为一种稀缺性。
可理论上的价值是一回事,真有公司愿意花钱买几百万册纸书,再一本本打开,只为了阅读其中的文字吗?
三、数百万册书,被送进“取字”流水线
这件事在美国已经发生过。
AI公司Anthropic曾花费巨额资金购买数百万册纸质书,其中许多是旧书。它们被送到服务商那里,没有进入阅览室,而是进入一套工业化的数字处理流程。
书先被拆去装订,书脊切开,纸页分离。散开的页面送入高速工业扫描仪,以每分钟几百页的速度转化成高分辨率图像。
紧接着,最新的 OCR视觉大模型接手,将图像中的文字、排版、表格瞬间提取为结构化的数字文本。
即使按每册只有数百页估算,数百万册书也意味着数亿乃至十亿页量级的处理工作。过去,这样的规模会让人想到一座大型藏书库。到了AI公司手里,它还可以是一座数字资料仓库。
看起来过程很简单:先把散落在纸上的内容,变成大模型能够搜索、分类、比较和重复调用的数据。
有些媒体还把这一套过程称之为硬核数字化。一本人类作者的著作,在流水线上只需几秒钟,就会经历从物理消亡到数字升华的全过程。
有人可能会问,既然电子文本用起来更方便,为什么不直接下载现成文件,还要付钱买纸书、拆书、扫描?
因为资料从哪里来,本身也开始值钱。
一本旧书,开始同时拥有三种价格。
第一种是书店货架上的价格。多年卖不动,它可能很便宜。
第二种是把它变成可靠数据的成本:采购、运输、编目、扫描、文字识别、纠错和存储。
第三种最难估算:它进入资料库后,能否帮助企业改进产品,并被反复使用。
一本书在古书店卖掉一次,交易当天就结清了。书里的内容却可能在买方的系统中被多次检索、选择和处理。
这就是这场旧书采购最有争议的变化:AI正在尝试把旧书从消费品重新定价为生产资料。
Anthropic就认为自己已经买书付过钱了,自己只是在合理使用,并不等同于侵犯原作者权利。
如果文字越来越像工业原料,谁来判断哪些书可以拆,哪些原件必须留下?
四、当文字成为原料,一条新的数据产业链正在形成
过去书店卖完一本书,交易就结束了。
新的采购链却可能一路延伸到扫描车间、数据中心、版权谈判桌和公共馆藏。每一环都要花钱,每一环也可能产生新的利润或争议。
AI竞争常被写成芯片和电力的竞争。但买书这件事提醒人们,还有一种资源散落在书架、地方馆藏和旧出版物里:高质量、可追溯的人类原始文本。
芯片决定模型处理信息的能力,电力支撑机器持续运行;资料则影响它能接触哪些知识,以及这些知识能否被核查。
这种资源在不同语言之间,分布并不均匀。
英语拥有规模庞大的数字内容,但日语、德语、法语,以及更多语言的地方知识、行业记录和旧出版物,仍有相当一部分留在纸上。
谁能更完整地编目、数字化和保存本国语言资料,谁就能让这些知识更容易进入下一代大信息系统。
大模型竞争因此不只是“谁先买到更多书”。更难的能力,是让文字变成机器可读资源的同时,保留它从哪里来、由谁写成、适合怎样使用,以及原件还在不在。
未来真正稀缺的,是同时具备三样东西的资料:真实的人类文本、清晰的来源、合法的使用路径。
回到日本那些古书店,店主仍在打包订单。我们尚不知道书最终去了哪里,也不知道买家会拿它们做什么。
但一个过去很少需要提出的问题,已经摆到了柜台上:
买家究竟要这本书,还是只要书里的字?
热门跟贴