一、神秘买家与“巴拿马计划”

近两年来,全球多家二手书店陆续接到大量订单——买家专挑冷门、绝版甚至小语种的旧书批量采购,出手阔绰,对价格并不敏感。有西班牙书店老板称,售出的加泰罗尼亚语旧书多为几十年前的宗教故事、酿酒手册甚至内战日记,几乎无商业价值,却被买家连番扫货。

打开网易新闻 查看精彩图片

二、为何瞄准2022年前的旧书

当AI模型用AI生成的内容继续训练时,会发生“模型塌缩”(Model Collapse)——模型输出质量逐代退化。2024年7月,牛津大学、剑桥大学等机构的联合研究登上《Nature》封面,证明递归训练下模型会不可避免地劣化。

因此,AI公司需要“干净”的人类原生语料。2022年ChatGPT发布之前出版的纸质书,在时间线上天然免疫AI生成内容的污染。更冷门、没有电子版的绝版书,则能提供互联网抓取不到的内容。

三、15亿美元和解:盗版电子书的代价

2024年8月,三名作家将Anthropic告上法庭,指控其未经授权使用他们的作品训练Claude。法庭材料显示,Anthropic曾从Books3、LibGen和PiLiMi等资源库下载超过700万本书,其中相当一部分来自盗版网站。

2025年9月,Anthropic同意支付15亿美元和解该集体诉讼。2026年7月,旧金山联邦法院正式批准该和解协议。和解涵盖约50万本书,每本书赔偿约3000美元。原告方律师称,这是“有史以来金额最高的版权赔偿”。

但需注意:这15亿美元和解针对的是从盗版网站下载的电子书,而非“巴拿马计划”购买的实体书。

四、法律灰色地带:买实体书、扫描、销毁,合法吗?

关于实体书的问题,联邦法院给出了不同的判断。

2025年6月,法官William Alsup裁定,用合法购买的书籍训练AI模型属于“合理使用”(fair use)。关于实体书的处置,法官认为Anthropic为每本书付过钱,扫描一本就销毁对应的实体书,只在内部保留数字副本,没有制造额外的副本投放市场,因此不构成侵权。

换言之,盗版电子书我认罚;但花钱买来的纸质书,切了也合法。

五、ISBNdb的争议与否认

在这一过程中,图书数据库公司ISBNdb成为争议焦点。该公司曾在其网站上公开宣称,可为AI实验室批量采购2022年前印刷的纸质书,作为训练数据。单次订单从1000本到100万本不等。

2026年7月30日,ISBNdb删除了相关页面,随后发布声明称公司“从未购买、扫描或销售过一本书——用于AI训练或其他任何目的”。该公司的实际角色和参与程度仍存在争议。

六、数据饥荒与知识垄断

目前,“巴拿马计划”仍在继续。这场围绕知识、版权与数据权力的博弈,远未结束。