当千百年积累的纸面文明被批量吸入科技公司的私有黑箱,一道隔绝公共知识的数字长城,正在我们毫无察觉的时候悄然拔地而起。
当AI开始焚书
2026年的二手书市场,正在上演一出荒诞的黑色喜剧。
全美各地的旧书商突然接到了神秘大单:买家不挑题材、不问作者、不看品相,甚至连价格都懒得还,只有两个硬性标准:一个是2022年之前出版,另一个是带有ISBN编号。
生意好的时候,有二手书商一周能卖出过去半年的量,销量翻五倍。
书商们不在意买家到底是谁,只知道这些书被整车拉走,送进郊外的仓库,切掉书脊、高速扫描,然后全部送进粉碎机打成纸浆。
如果不仔细观察,还以为是造纸厂在回收废纸。但真相很离谱:这是硅谷的AI巨头们,正在进行一场规模空前的知识采矿。
从Anthropic秘而不宣的“巴拿马计划”,到如今整个AI行业集体下场扫货,短短两年时间,“买书、扫描、销毁”就已经从一家公司的灰色操作,变成了整个AI行业心照不宣的生存法则。
当初事情浮出水面,是因为一场天价官司。
2024年,多名作家联合起诉Anthropic侵权,法庭文件意外扯出了一个代号“巴拿马计划”的秘密项目:这家以Claude大模型闻名的公司,斥资数千万美元从全球采购数百万册纸质图书,聘请专业扫描公司切掉书脊进行高速数字化,扫描完成后便将实体书烧掉销毁。
Anthropic还挖来了谷歌图书项目的前负责人,目标直白但吓人:扫描世界上所有的书。
这场官司以Anthropic赔偿15亿美元告终,但判决细节却颇有意思:认定公司保存700万本盗版电子书数据库属于侵权,但合法购买纸质书后破坏性扫描用于AI训练,属于版权法上的合理使用。
也就是说,这一判决,认为AI公司收集图书再烧掉是合理的。
但原本随着藏在水下的操作摆上台面,事情就刹不住车了:
有1.1亿本图书目录的ISBNdb直接上线了AI企业专属采购服务,号称能帮客户一次采购100万本旧书,还严格保密买家身份;
Alibris、Biblio等二手书平台上,大宗订单开始批量出现,从小说、教材到专业工具书无所不包,唯一的共同点就是出版时间都在2022年以前。
谷歌、Meta等巨头也被卷进同一条赛道,出版商联盟刚刚在7月对谷歌提起诉讼,指控其用数百万本版权图书训练Gemini模型。
没人说得清现在到底有多少家公司在做这件事,因为中间商的保密协议把买家身份捂得严严实实。但二手书市场的异常不会说谎,那些躺在仓库里积灰的冷门书、绝版书,一夜之间都成了抢手货。
硅谷为何纸贵?
AI公司放着浩瀚的互联网不用,花大价钱买纸书、拆书、焚书,只有一个原因:互联网已经被AI自己污染得没法用了。
前面提到过,这些AI公司收书,只收2022年之前的。因为2022年是一个重要节点:ChatGPT爆火,生成式AI像洪水一样漫过了整个网络。
博客、问答社区、百科词条、自媒体文章,甚至学术论文网站里,机器生成的内容占比逐年飙升。到2025年,有研究统计全网新增英文内容里已经有超过一半是AI产物。这些内容良莠不齐,很多是AI抄AI、AI喂AI的循环产物,事实错误、逻辑滑坡、语言平庸,被业内统称为“AI垃圾内容”。
垃圾吃多了,AI自己也会变傻。
牛津、剑桥等机构的研究者早在2023年就证明了这一点:用AI生成的内容反复训练新模型,会引发不可逆的“模型坍塌”。就像把复印件再拿去复印,一代一代下去,图像会越来越模糊,最终只剩下一团模糊的斑块。
放到语言模型上,就是模型会逐渐忘掉小众词汇、冷门知识和特殊表达,直到收敛到一堆平庸、正确、毫无新意的套话里,连基本的事实准确性都保不住。
而且这种污染还在累积。
哪怕训练数据里只有0.01%的虚假文本,都可能让模型的有害输出增加11.2%。而现在的互联网,早已不是百分之零点几的问题,是整片数据海洋都在变浑。
在这样的背景下,2022年之前出版的纸质书,成了数据净土。
这些书经历过出版社的三审三校,知识密度高、逻辑严谨、语言质量有保障,更重要的是,它们诞生在生成式AI爆发之前,是人类原创,不存在任何机器污染。
这本身就是一个讽刺:AI越发达,人类亲手写的文字就越值钱。更讽刺的是,越值钱,就越要销毁。
数字长城拔地而起
扫描完了把书捐给图书馆、卖给旧书店不行吗,为什么要毁掉?
答案藏在三层逻辑里,一层比一层现实,一层比一层冰冷。
表层的理由是效率与成本。
非破坏性扫描要一页一页翻,或者用昂贵的V型扫描仪,速度慢、人工贵。而破坏性扫描只需要用液压机切掉书脊,把散页送进工业高速扫描仪,效率能翻好几倍,成本却低得多。
对AI公司来说,书不是需要保存的文化载体,是一次性的数据耗材。
中间一层是法律算计。
正版书扫描被判合理使用的前提,是公司获得了实体书的所有权,且扫描行为具有转换性用途。如果扫描完还把书重新投入流通,就容易被版权方抓住把柄:你买一本扫描完又卖出去,等于一份实体书对应了无数份数字副本,这和盗版有什么区别?
而销毁原件,等于切断了追溯链条,把复制传播的嫌疑降低。
深层也是值得警惕的逻辑,是知识的私有化与垄断。
这些被扫描进数据库的内容,不会像图书馆里的书籍一样向公众提供预览,更不会开放给大众使用。它们会被锁进AI公司的私有训练库,变成模型参数的一部分,变成商业竞争的护城河。普通读者再也没法免费读到这些内容,未来想要获取其中的知识,只能通过和AI对话的方式付费获取其中的片段。
尤其是那些孤本、冷门专业著作。全世界可能就剩几千本甚至几百本,AI公司批量买走扫完就毁,等于把这些知识的实体备份彻底抹掉,只剩下他们服务器里的私有版本。
已经有藏书家和图书馆从业者反映,很多存世量稀少的外文专著、地方史料,正在以反常的速度从二手市场消失。
数字长城正在拔地而起。
一本一本被焚毁的纸质书,正在变成一块块砖石,在商业公司的服务器里垒起高墙。墙内是被AI消化过的人类知识遗产,墙外是再也接触不到原始文本的公众。
人类用实体书的消亡,换来了更聪明的AI;用公共知识的私有化,换来了大模型的参数提升。
曾经我们以为,AI会让知识更平等、更开放、更易得。但现在的AI公司,走了一条完全相反的路:他们把书数字化,然后锁起来,变成自己独有的资产。
知识没有因为技术变得更公共,反而因为商业变得更封闭。
这场焚书运动还在继续,二手书的价格还在涨,更多的书还在被送进粉碎机。墙筑起来容易,再想拆掉,就难了。
热门跟贴