一刻 talks | 思想实验
有一种交易,正在全球各地的二手书店悄悄发生。
买家不露面,只下"不同寻常"的大宗订单,书到手之后,他们把书脊一刀切掉,纸页送进高速扫描仪,扫完的纸质原件,直接送去粉碎销毁。
被这样处理的,不是普通旧书,是2022年之前出版的、市面上很难再找到第二份的绝版书。
干这事的,可能是AI公司。
它们不是要藏书,也不是要卖书,它们要的,是书里那些"还没被污染过"的字。
这件事为什么值得你花五分钟读完 你每天在手机上写下的每一个字、发的每一条动态,都可能已经被AI吃掉了,而当互联网上的"人话"被AI吃干、吃脏之后,AI自己,也开始慌了。 它慌的,恰恰是你我随手就能写出来的东西,那些带着错别字、带着脾气、带着温度的人类文字。
我们不替你惊呼"AI要烧书了",我们帮你看清楚,一个靠"吃人话"长大的东西,是怎么亲手把"人话"吃成稀缺品的。
它们切书脊、扫描、再粉碎
到底在图什么
先把这个流程说清楚。
据404 Media报道,英国、爱尔兰、美国、澳大利亚的二手书店,最近接连收到大宗订单,买家来自美加欧等地,身份或是AI公司。
书到手后,工人用液压切割机把书脊整个切掉,散开的纸页送进生产级高速扫描仪,转成PDF,扫完,纸质原件打包送去粉碎。
为什么非得销毁?两个原因:一是防止这些书再次流入市场、被别的AI重复训练,二是,合法的销毁,反而能规避版权风险。
听起来荒诞,但这套"买书,切书,扫描,粉碎"的流水线,已经在全球跑了很久。
最出名的,是Anthropic内部一个叫"巴拿马计划"的项目,累计处理了约50-200万册实体书。
马斯克随后表示,这不是SpaceXAl的做法
一旦数据被录入,这些原本可以流传百年的孤本,就变成了废纸浆。这种行为在技术圈被称为“物理销毁以确保数据独占”。
为什么非得是"2022年前"的书
这里藏着整件事最冷的一个逻辑。
为什么只要2022年前的书?因为2022年11月,ChatGPT出现了。
在那之前,互联网上的文字,几乎全是人写的,在那之后,AI生成的文字开始疯狂涌入。
有机构统计,2025年互联网新内容里,AI生成的比例已经超过一半。
换句话说,互联网,这个AI最初的食物来源,已经被它自己"吃脏"了。
而2022年前出版的纸质书,是仅存的、几乎100%由人类亲手写、经过编辑校对的东西。它们是AI能找到的最后一批"干净语料"。
"模型崩溃"
AI吃自己吐出来的,会变傻
这不是杞人忧天,是有论文的。
2024年,牛津大学等团队在《自然》上发表了一篇研究,给这个现象起了个名字,叫"模型崩溃"(Model Collapse)。
结论很简单,也很吓人:用AI生成的数据去训练AI,模型会一代比一代退化。
研究称:模型崩溃是一种
影响生成模型的退化过程
研究里有个著名的例子,一段中世纪建筑的文本,让AI反复"自我学习",传到第9代,输出的已经是一串野兔的名字。
为什么会这样?因为AI生成的内容,天然带着"信息损耗"。让它学自己的输出,就像复印机反复复印同一张纸,越印越模糊,细节越丢越多。
早期,它忘记的是冷门知识、小语种、罕见的事实,晚期,它连"现实本身"都忘了,输出的是一堆语法通顺、但毫无意义的废话。
人类的高质量文本,快被吃光了
这才是真正的危机。
有测算机构预估,按现在的消耗速度,语言模型会在2026到2032年之间,把互联网上能公开获取的高质量人类文本基本耗尽。
到那时,AI将面临一个它自己亲手造成的困境:
它想继续变聪明,但"人味"这个原料,被它自己吃光了。
对AI训练来说,数据“干净”至关重要
这给了旧书新的价值
更讽刺的是,现在互联网的访问流量里,超过一半来自AI和爬虫,人类手动访问反而成了少数。有人形容:现在的互联网,更多时候是AI在跟AI说话,人类成了旁观者。
一个靠"人话"训练出来的系统,正在把"人话"从它自己的世界里挤出去。
这跟我们每个人,到底有什么关系
AI在满世界抢购的,是"还没被AI碰过的人类文字"。而这件事最让人后怕的地方在于,它正在重新定义"什么东西值钱"。
过去,值钱的是"多":写得多、发得多、数据多。现在,值钱的是"纯":没被AI碰过的、真实的人类表达,正在变成稀缺品。
书店对很多人来说是一种独特的文化符号
你随手写的、带着错别字和脾气的那句话,可能比一屋子AI生成的文章都值钱。
因为它是"原版",而"原版",正在从地球上消失。
明天,我们聊聊,靠线上干掉中间商的巨头,如今回头扎堆开起了线下店……
关注「一刻talks」
我们帮你看清楚,当AI开始回头抢“原版”,你最该守住的,是你身上那些“还没被复制”的东西。
热门跟贴