一本旧书在书店里落灰多年,终于等来了出手阔绰的大买家。

遗憾的是,这位买家并没准备读它,而是直接把它送进了切书机

冷门书上架时无人问津,到了AI时代,身价却突然取决于能不能被拆成训练数据。

打开网易新闻 查看精彩图片

科技媒体404 Media与书商合作,把一枚AirTag藏进一笔约1000册的图书订单。追踪器跟着货物横穿美国,最后进入亚马逊位于拉斯维加斯的仓库。

仓库里的VGT3部门专门处理纸质书。员工扫描ISBN条码,切掉书脊,再把散开的书页送进扫描设备。

亚马逊承认,这些书通过正规商业渠道购买,用于开发和改进客户使用的产品与服务。但公司没有公布书目、处理数量和设施规模。

404 Media把这批书称为rare books。这里的rare主要指流通副本少,包括小印量、外文和绝版图书。例如旧旅行指南、软件操作手册、地方史和专业资料。

这恰恰是AI公司需要它们的原因

一本书在二手市场上的价格,取决于还有多少读者愿意购买。但它对AI公司的价值,则取决于内容是否已经进入训练数据。

畅销书、新闻和百科早已被大量数字化,同一批内容还会在网上反复出现。一本小语种著作或者绝版专业资料,互联网上可能只有书名和ISBN,正文从未进入公开数字世界。

一册摆了20年也没人买的书,在书商眼里是积压库存。到了AI公司的采购清单里,它可能代表一块竞争对手尚未获得的数据。

打开网易新闻 查看精彩图片

这和“模型崩溃”直接相关

《自然》杂志2024年发表的一项研究发现,如果新模型不断使用旧模型生成的内容训练,最先消失的往往是数据分布尾部的信息。

所谓分布尾部,就是出现次数很少的知识和表达。热门话题和常见语言容易被保留,小语种内容、地方知识和冷门专业经验会更早被忽略。

研究还发现,保留一部分最初的人类数据,可以明显减轻这种质量下降。互联网里的AI文章越多,来源清楚的人类原始文字也就越值钱。

模型反复使用AI生成的内容训练时,最先丢失的往往是低频信息。稀少旧书保存的恰好是这种低频知识。

2022年以前出版的纸质书,至少避开了这一轮生成式AI普及后产生的机器文本。当然,旧书也可能内容过时或者质量很差,AI公司仍需继续筛选。

亚马逊为什么要购买纸质书,却不用自己庞大的电子书库?

首先,有些绝版书没有电子版。

其次,电子书受到的限制更多。亚马逊最新版Kindle条款明确规定,Kindle内容是许可使用,没有把电子文件的所有权卖给读者。使用范围通常限于个人阅读,购买者也不能绕过数字版权保护。

打开网易新闻 查看精彩图片

对普通读者来说,这只会影响文件能否下载和转卖。

但对需要批量提取正文的AI公司来说,它会带来合同和版权风险。

纸质书的来源更容易证明

美国版权法中的“首次销售原则”允许购买者转卖、出租或者销毁手中的合法副本。虽然买书不会自动获得全文复制权,却能提供一张清楚的交易凭证,证明这一册书来自合法渠道。

2025年的Anthropic版权案件,又给AI行业提供了一条参考路径。

Anthropic早期从盗版书库下载了数百万册电子书。为了获得来源更加清楚的数据,公司后来启动“巴拿马项目”,花费数百万美元购买数百万册纸质书,切除装订,扫描书页,再丢弃原书。

美国联邦地区法院随后认定,在该案的具体条件下,把合法购买的纸质书转换成内部数字副本属于合理使用。

原书已经被销毁,扫描文件也没有向外界传播,法官因此把数字文件视为纸质书的一对一替代。Anthropic此前使用盗版书库的行为没有获得免责,后来的15亿美元和解处理的正是盗版来源问题。

这项判决没有规定AI公司必须销毁纸质书,也不能覆盖今后的所有案件。但企业很容易从中读出一条风险较低的路径。

买进一册纸书,留下一个内部数字文件,再销毁原件。公司更容易证明自己只改变了载体,没有增加可以继续传播的完整副本。

打开网易新闻 查看精彩图片

成本也在推动企业作出相同选择

保存原书需要逐页翻动,还要处理书页弯曲和阴影。

切掉书脊以后,整本书可以直接进入自动进纸设备。市面上的工业扫描设备每分钟能处理上百页,一本300页的书几分钟就能完成图像采集。

于是,一本冷门旧书从低价库存变成了企业内部的稀缺数据,纸质原件却退出了公共流通。

一本几十年没人看的旧书,终于因为AI获得了新价值。但令人难受的是,价值被留下以后,书却没能留下。

这样看来,2022年以前出版的旧书,如今又多了一层价值,它们大多数是人自己写的。此后出版的书可能仍然会由人创作,但AI起草、改写和润色会越来越常见,人类写作与机器参与的边界也会越来越模糊。

守住你手里的那些个旧书吧!AI公司每采用一次破坏性扫描,市场上就少一册可以继续流通的原书。对已经绝版、存量很少的书,少掉的这一册可能再也补不回来了。

如果一本书已经只剩下很少的流通副本,你认为AI公司买下以后,是否应该拥有直接销毁它的权利?