一本全新的书,从仓库货架上被取下,扫描进系统,然后送进粉碎机。这不是图书回收,而是亚马逊AI训练流水线的一环。本周,404 Media的记者Emanuel跟进报道了这条此前鲜为人知的链条——他找到了一位曾在亚马逊仓库工作、亲身参与销毁图书的员工,聊了聊这份工作的真实日常。
销毁不是意外,是流程
在这位员工的描述中,销毁图书并非偶发的库存清理,而是持续运转的标准流程。仓库里每天都有大量图书被处理,它们被扫描、录入,随后走向粉碎。这些书不是滞销品,也不是残次品——它们被选中,是因为亚马逊需要它们的文字内容来训练AI产品。
换句话说,书的物理形态在进入仓库的那一刻就已经不重要了。重要的是书里的文字被提取出来,变成训练数据。书本身,则成了流程末端必须被处理掉的“废料”。
为什么必须销毁?
这位员工没有给出亚马逊内部的官方解释,但从流程逻辑看,销毁是闭环里不可省略的一步。扫描后的书如果流入二手市场或退回出版社,内容可能被二次传播,而训练数据的版权边界会变得更加模糊。销毁,意味着物理载体彻底消失,只留下已经被“消化”的文字。
这也解释了为什么这项工作如此隐秘——它处在版权灰色地带和商业机密的交界处。仓库员工看到的只是流水线的一环,但这一环背后,是AI训练对内容的海量需求与版权规则之间的巨大张力。
AI训练的数据饥渴,正在改变仓库的运转方式
过去,仓库的核心指标是周转率和库存准确度。现在,某些仓库多了一条隐形的KPI:每天处理多少本书进入扫描销毁流程。这位员工的工作内容因此变得机械而重复——拆封、扫描、确认、送入粉碎机。他告诉Emanuel,这份工作让他对“书”的感觉变得复杂:书不再是知识的载体,而是流水线上的原料。
这种感受并非个例。AI训练对文本数据的需求几乎是无限的,而版权清晰的图书是其中最优质的语料之一。当需求足够大,供应链就会以意想不到的方式被重塑——包括让仓库变成销毁车间。
同一批“名字”反复出现在AI输出里
本期播客的后半段,Emanuel和同事Sam聊到了另一个现象:在大量大语言模型的输出中,总是反复出现同样的几个名字。这些名字像幽灵一样,在不同模型的回答里穿梭,无论用户问什么,它们都会以某种方式浮现。
这不是巧合。它指向的是训练数据的高度同质化——当各家模型都依赖相似的公开语料库时,输出中的“高频名字”就会趋同。那些在语料中被反复提及的人名、机构名,成了模型输出中的“地标”,无论上下文如何变化,它们都会被模型优先“想起”。
数据同质化,正在让AI变得“脸盲”
这种同质化的后果是:模型对世界的理解越来越依赖少数几个信息源。如果这些名字代表的观点或事实存在偏差,模型的输出也会被系统性带偏。更麻烦的是,用户很难察觉这一点——因为模型给出的答案看起来总是流畅、自信、有理有据。
Emanuel和Sam在节目里没有给出解决方案,但他们点出了一个值得警惕的趋势:当AI的训练数据越来越集中,AI的“世界观”也会越来越窄。而那些被反复输出的名字,就是这条窄路上的路标。
订阅用户专属:ICE与选民数据
本期播客的订阅用户专属部分,Joseph聊了一个更硬核的话题:美国移民与海关执法局(ICE)正在大量购买与“选民欺诈”相关的数据。这笔数据采购的规模、用途和合法性,都引发了不小的疑问。
为什么ICE需要选民数据?这些数据从哪里来?它们会被用来做什么?Joseph在节目中给出了他的调查发现。这部分内容仅对付费订阅用户开放,也是404 Media维持独立调查报道的重要支撑。
播客之外:404 Media三周年线下活动
本期节目还预告了404 Media的三周年纪念活动——一场线下直播派对。届时会有更多深度内容的现场分享。如果你对AI训练背后的供应链、数据同质化问题,或者ICE的数据采购感兴趣,这场活动或许值得关注。
回到开头那个问题:每天有多少书在仓库里被销毁?这位员工没有给出精确数字,但他确认了这件事的规模远超外界想象。当AI的胃口越来越大,销毁流水线的转速,恐怕只会越来越快。
热门跟贴