电子书普及十几年,实体书一直在退潮。但近日日本二手书店的老板们遇到了反常的一幕:有人不挑版本、不问品相,按吨下单买书,日销量冲到数百本,部分时段销售额涨到平时的5倍。
9月25日,据日本电视台NTV获取的记录,一笔50吨的日本书籍订单已被发往美国,进入Anthropic的扫描处理流程。多家书店的订单都指向同一个收货地址:冈山县某物流中心。
买家不为收藏,不为转售,甚至不为阅读——书被扫描成数据之后,直接粉碎。人类知识的纸质载体,正在被AI公司成吨地吃掉。
表面是买书,实际是圈地
更值得玩味的是采购清单。东京一家书店店主告诉NTV,以往最畅销的是小说和漫画,近日的批量订单却集中在哲学、历史、政治史、医学、法律,以及江户时代的生活与文化等题材。
这几类书有一个共同点:知识密度极高。小说提供的是情节和语感,而哲学、医学、法律提供的是体系化的概念、推理链条和专业共识——这正是AI训练语料里最值钱的部分。
随着互联网上公开可得的文本被大规模采掘,数字世界里"免费的午餐"越来越少。营销软文、机器生成的注水内容充斥网络,真正高质量的语料反而沉淀在纸质书里。于是AI公司的采购车头一转,从爬虫扫描网页,变成了卡车按吨拉书。
这不是买书,是圈地——谁先把实体知识吃进模型,谁就先占住了下一轮竞争的语料高地。
扫描后粉碎:一条只进不出的传送带
很多人会想:扫描就扫描,为什么非要粉碎?把书销毁,是不是太浪费了?
关键就在这一步。数字化并不等于共享。扫描件进入Anthropic的服务器后,成为不对外公开的私有语料;而原书一旦粉碎,它在公共流通领域就被物理抹除了。
过去一本书的命运是这样的:它在书店、在图书馆、在旧书摊流转,任何路人都能翻开它。现在它的命运变成了一次单程传送——纸上的知识被抽取成数据,载体随即消失,知识本身则封存在一个普通人无法查阅的模型里。
想再获得这份知识?可以,但要通过AI公司的产品提问,由算法决定给你什么答案。知识从"可借阅"变成了"可查询",而查询的规则,不再由读者掌握。
这是AI语料采集史上一次标志性的转向:采集对象从数字世界溢出到了实体世界,而这一次,连回收的余地都没留下。
法律追不上的"合法"操作
版权当然是绕不开的问题。在日本现行法律下,除非能证明扫描行为不公平地损害了版权方利益,否则以AI学习为目的的扫描仍属合法。
但请注意这笔操作的三个特征:批量、跨境、隐秘。在这样的流程里,不会有任何一位作者被征询意见,甚至不会有人知道自己书里的内容正在被抽取。法律管的是"是否造成损害结果",而当损害分散在千万个权利人身上、又以数据形式发生在境外服务器里时,现行框架几乎无从下手。
以往围绕AI训练数据的争论,大多停留在"用没用我的内容"层面。而这一次,事情多走了一步:不只用了,还把原材料销毁了。买下的是纸张,拿走的是流通,留下的是一个法律尚未定义的空白地带。
输家是知识的公共性
二手书店店主们心情复杂:销量暴涨带来的是真金白银的短期收入,但如果书籍被批量移出流通市场,长期来看库存供应会被掏空,定价体系会受冲击,珍稀版本可能就此绝迹。
有人会说,AI训练总需要数据,一手交钱一手交货,天经地义。这话对了一半——问题从来不在"用",而在"销毁、不问、私有化"这三件套连在一起做的时候。交易完成的那一刻,书店赚到了钱,AI拿到了语料,被跳过的是作者的知情权,被牺牲的是未来某个读者在旧书堆里与一本好书不期而遇的机会。
知识的公共性就是这样被一点点让渡出去的:每一笔单看都合理,连起来却是一条只进不出的传送带。
这场吨级扫货给整个行业提了个醒:当AI开始按吨吃书,需要被讨论的就不只是数据合规,而是我们打算把人类的知识,交给谁来保管。
✦ ✦ ✦
如果这篇内容让你看到了AI语料战争的另一面,欢迎点赞支持,另外,关注我们,后续还有更多深度分析。
热门跟贴