如果你最近查过某部电影的票房、预算或流媒体数据,很可能用过The Numbers的数据库——即使你自己没意识到。
这家网站手工整理了78,396部电影、17.8万条院线发行记录和23.6万从业者的数据,年访问量超过800万,被记者、学者、制片人、预测市场甚至吉尼斯世界纪录视为最权威的行业数据源。
正因如此,2026年3月5日发生的事才让整个行业措手不及:TheNumbers.com突然从互联网上消失了。
网站宕机超过一周,没有任何解释。重新上线时,体量已缩水到原来的零头——历史排行榜没了,单部电影页面没了,用户最爱的Report Builder也消失了。页面上只剩一句“我们正在重建,请耐心等待”,互联网则照例用困惑、愤怒和阴谋论填满了这个信息真空。Reddit上甚至有帖子猜测,这是一场蓄意的抽毯行动,目的是搞垮免费站点,把用户推向付费产品。
三个月后,我与The Numbers创始人兼CEO布鲁斯·纳什聊了聊事情的全貌。他描述的是一段很不愉快的经历:“我们收到了大量愤怒的邮件,人们质问‘你们以前那个页面哪去了’。”
The Numbers的故事始于1997年10月17日。当时,数学家出身的前IBM软件开发者纳什启动了一个Geocities站点,追踪300部电影的数据。他在二十周年纪念文章中回忆(这篇文章如今只存活于互联网档案馆,原因后面会说):“我在Access数据库里按了个按钮,把一些HTML页面上传到Geocities,然后在好莱坞证券交易所的留言板上发了个简短公告,告诉大家我开始分析电影票房,帮他们在HSX上挑选电影股票。”
从那个简陋起点出发,纳什和他组建的团队一步步把The Numbers做成了电影业最可靠的财务数据源。
过去二十多年间,网站面临的挑战发生了根本变化。头二十几年,流量可控,来访者也大多礼貌。用纳什的话说:“AI时代之前,我们收到的都是人类流量、行为规矩的搜索引擎爬虫,以及少数为了个人项目抓取站点的用户。如果有人贪得无厌,我们很容易发现并封禁。”
然而过去两三年,全世界的网站主都目睹了流量的质变——浏览者越来越少,机器人越来越多。而The Numbers作为业内“山羊”(GOAT,史上最佳)级别的存在,恰恰成了这场变革中最显眼的靶子。
纳什在对话中解释了一个关键细节:AI公司训练大语言模型时,对结构化数据库的需求极度饥渴。The Numbers这种经过人工校验、涵盖近三十年跨度的精确财务数据,远比人们在社交媒体上的闲聊有价值得多。为了抓取这些数据,AI爬虫以远超普通搜索引擎的频次和伪装手段冲击服务器,最终在3月5日那天,冲垮了整个站点的后端架构。
纳什和他的小团队面临的困境并不复杂:要么大幅缩减公开可用的数据量以保护服务器成本,要么看着网站彻底停摆。他们选择了前者——砍掉历史查询功能,简化页面结构,把数据库主体移到付费产品的保护墙后面。这也就是为什么纳什那篇二十周年纪念文章,如今只能去互联网档案馆找。
这件事真正让人不安的地方在于:The Numbers不是第一家被AI爬虫搞垮的公开数据源,也不会是最后一家。当互联网上最可靠的那批手工数据因为被过度抓取而被迫退场,留下来的会是什么?
热门跟贴