如果你最近去过东京的神田神保町——那个被誉为世界最大古书店街的地方,可能会注意到一种极为诡异的景象。

这里的古书店主们,接待了一批奇奇怪怪的“大客户”。

有店家一天就被扫走上百本,有的店铺累计卖出了上千册。买家注册的账号名称五花八门,但包裹最终的送达地址,却全都指向了同一个跨境物流中转站。

按一本书500克粗算,50吨相当于整整10万册纸质书。那些藏在书架深处、落满灰尘的纸质知识,正在被整箱整箱地塞进集装箱,运往大洋彼岸。

顶尖的高科技AI公司,怎么突然对古董摊上的“破纸”产生了如此饥渴的食欲?

答案既科幻又讽刺:在吞噬了几乎整个互联网之后,大模型终于没饭吃了。它们开始“吃纸”了。

打开网易新闻 查看精彩图片

过去几年,人工智能的进化逻辑简单粗暴:大力出奇迹。只要模型够大,数据够多,AI就能越来越聪明。硅谷的爬虫机器人像蝗虫过境一样,把全球网页上的维基百科、论坛贴吧、新闻报道、甚至社交平台上的吵架纪录全给吃了个遍。

但人类在网络上留下的字,毕竟是有限的。

打开网易新闻 查看精彩图片

这就是让硅谷所有首席科学家夜不能寐的“数据墙”(Data Wall)。

面对即将见底的网络数据库和遍地有毒的垃圾信息,硅谷巨头们放眼全球,猛然发现:最纯净、最具有逻辑深度、绝未被AI污染过的“高蛋白粮源”,居然全部静静地躺在那些没有被数字化的实体纸质书里。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

既然互联网的数据榨不出来汁了,那就只能对实体书下手。

你可能以为AI公司买书回去,是安排一排工作人员坐在桌前,小心翼翼地翻页扫描?那太低估科技新贵们对效率的狂热追求了。在硅谷,把纸质书变成训练集的过程,充满了工业时代最原始的暴力美学。

巨头们买来成吨的实体图书,甚至根本不看内容,直接送进工业级切纸机。随着铡刀轰然落下,珍贵的书脊被瞬间切掉,一本本厚重的著作瞬间化为几百张散落的单页。

打开网易新闻 查看精彩图片

什么叫硬核数字化?这就叫“拆书炼丹”。

打开网易新闻 查看精彩图片

首先,是极高的数据纯度与排版质量。日本从近代以来就拥有极其庞大的出版业,印刷工艺精良,字体排版高度规范。

这种高质感纸张和清晰的印刷,让现代 OCR 软件的识别准确率几乎高达 99.9%。相较于某些印刷质量参差不齐、扫描出来满屏糊字的其他语种旧书,日本古书简直是整理数据工程师的梦幻食材。

打开网易新闻 查看精彩图片

是不可替代的“领域知识深度”。这次神秘买家扫荡的重点,包含了大量的“地方志”(地方历史记载)、过期的法律判例集、以及昭和时代的行业报告。这些东西在当年发行量极小,且极少被上传到互联网。里面记录的社会运行逻辑、人情世故、法律博弈和历史细节,是任何现代网页都提供不了的纯净逻辑链条。

当别的AI还在用网络热梗和口水话跟用户打嘴仗时,吃了50吨日本地方志和旧法学著作的大模型,其底层逻辑推理能力和知识储备,直接实现了降维打击。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这是一场发生在21世纪的奇特轮回。

几万亿美元估值的顶尖高科技公司,最核心的竞争壁垒,居然取决于它们能从古董摊上收走多少吨废纸。几十年前人类用油墨压进纸张里的思想,如今变成了数据中心里滚烫的电流。

当这50吨老书被扫描切碎、彻底咽进大模型的肚子里,未来的AI在与我们对话时,字里行间也许会不经意间流露出某种昭和时代的古朴肃穆,或是偏远村落的悠远历史。

这也给所有人提了个醒:在这个算力即王道、数字容易被篡改和污染的时代,最安全、最真实、最不受AI干涉的知识存储器,可能不是任何加密硬盘,而是你家书房里那本触手可及、沾着尘土的纸质书。

毕竟,只要它们还没被塞进扫描仪切掉书脊,人类就依然保留着对这份智慧最原始、最独占的解释权。

打开网易新闻 查看精彩图片