今天刷到一条消息,直接把我看愣了。

404 Media的最新报道扒出了一条黑色幽默式的操作链:AI公司为了训练模型,正在通过中间商匿名收购实体书,一本本切碎、扫描、丢弃,然后假装这事跟它们没关系。目的很简单——别让“AI公司销毁数百万本书”这种标题再上热搜。

打开网易新闻 查看精彩图片

但纸终究包不住火,这个遮遮掩掩的产业链,还是被掀了个底朝天。

❶ 口碑早就崩了,AI 自己心里门儿清

先看背景。这两年AI的公关形象什么样,兄弟们懂的都懂:气候变化愈演愈烈,AI数据中心的耗电量却呈指数级疯涨;数据中心周边的社区频频曝出有毒污染物泄漏,居民健康直接遭殃;更别提那一长串科技大佬的公开宣言,翻来覆去就一个意思——未来“大多数甚至所有”职业,人都可以被AI替换。一波接一波,AI产业愣是把自己整成了大众厌憎的“顶流反面教材”。

所以AI公司自己也非常清楚,大摇大摆地买书、毁书这件事,有多招人恨。

❷ 为什么非得是实体书?

这就得说到一个扎心的死循环了:现在的网络信息环境,越来越像一锅被AI反复回锅的“电子泔水”,高质量、未被污染的人类手写文本,反而越来越难找。对于正在烧钱狂奔的AI模型军备竞赛来说,训练数据集必须不断膨胀,而那些诞生在大语言模型泛滥之前的实体书,就成了最干净、最纯粹的人类语料——尤其是一些足够冷门的稀有书籍,竞争对手的数据集里压根就没有,谁先扫到谁就占了独家优势。

讽刺不讽刺?AI把互联网搅成了一滩浑水,然后又回过头来疯狂抢实体书,因为只有纸页上还留着没被污染过的文字。

❸ 最骚的操作:合法,但不敢说

书扫完最后一页,对AI公司来说就失去了全部价值。2025年一项法院裁决,直接让外界看到了这背后的处理流程有多糙:法庭文件披露,Anthropic在训练Claude模型的过程中,把数以百万计的印刷书籍切开、去脊,整本扫描后直接丢掉。法官最后裁定,这种行为构成了一种“转换性使用”,符合《版权法》第107条所谓的“合理使用”,因此说白了——毁书不但比保存更省钱,而且在法律上还站得住脚。

但法律上能过关,和“敢做敢当”完全两码事。《华盛顿邮报》就曾曝出,在一场作者发起的版权诉讼中解封的内部文件显示,Anthropic心知肚明,“法律上或许辩得赢”和“这事干得漂亮”根本不是一码事。诉讼最终以该公司掏出15亿美元和解金收场,但更耐人寻味的是内部讨论的原话。

在这些内部规划文件里,Anthropic说得再直白不过:“我们不希望外界知道我们在做这个。”他们很清楚,仅仅为了让聊天机器人说话不像“低质量的网络黑话”,就碾碎数百万本书,绝不会是什么拉好感的行为。

❹ 于是,中间商登场了

既然自己出面买书毁书太招眼,那就找个白手套。据404 Media的最新调查,Anthropic等AI公司现在开始花钱雇中间商来承担这脏活——专门帮他们大批量匿名采购实体书。

一家名叫ISBNdb的公司,就在自己的官网上明目张胆地挂过这样一个服务页面:提供印刷书籍采购服务,文案写得清清楚楚——“根据您的LLM训练需求量身定制”。更妙的是,报道一出,这个页面在今天早些时候还挂在网上,现在已经火速撤干净了。

换句话说,一条“出版商和旧书商不知情卖书—中间商匿名收购—AI公司扫描销毁—推说毫不知情”的流水线,已经转了好一阵子了。而书店经营者们最近也感觉到了不对劲:突然涌进来一大批看似毫无规律的稀有书籍订单,越是平时无人问津的老古董越被抢着要。这些书商开始心里发毛,因为在利润的另一头,他们很可能正无意中靠卖书给书籍“收尸人”赚钱。

❺ 到底打了谁的脸

整件事拆开来看,就是一场大型现实讽刺剧。AI公司想绕开的根本不是法律,而是公众的唾沫星子。内部文件里那句“别让人知道”已经说明了一切:它们要的是悄悄把人类的知识结晶当成一次性耗材,用最物理的方式吃掉、嚼烂、吐掉,然后若无其事地对外夸自家模型“语言能力又有突破”。

而那条被临时下架的中间商页面,也成了一个绝妙的注脚:在被曝光的前一秒,它们还在理直气壮地卖“AI训练专用书籍”解决方案;曝光之后,只剩一个404。这反应速度,倒是挺AI的。