AI技术的普及,并没有让每个人访问网络都变得更容易——相反,AI公司的大规模爬虫正在把很多网站直接“抓”到宕机。当你满心期待打开一个技术博客或开源文档站,浏览器却弹出一行冰冷的“正在验证你不是机器人”,这背后其实是一道防线在起作用:一个叫Anubis的保护方案,正用工作量证明(Proof-of-Work)强迫AI爬虫为每一次抓取付出真金白银的算力成本。
Anubis的出现,本身就是一种带有妥协意味的防御策略。网站管理员将它部署在服务器前端,目的很明确——阻止那些以数百万、数千万次级别发起的自动化内容抓取。AI公司为了让自己的模型“吃”到更多数据,会无差别地爬取各类公开网站,这种行为的即时后果就是服务器资源被瞬间占满,普通人反而打不开页面。Anubis干脆选择了一个直击痛点的思路:既然无法在IP、请求频率上精准甄别爬虫,那就让每次访问都附带一次微小但必须完成的计算任务。
这个计算任务的灵感来自Hashcash。Hashcash当年是为了对抗垃圾邮件而提出的工作量证明方案:发送邮件前,发件方需要消耗一点CPU时间解出一道数学题;对普通用户来说,这几乎无感,但对发送海量垃圾邮件的机器而言,叠加的成本足以让整套生意无利可图。Anubis把同样的逻辑搬到了Web访问上。每个访客的浏览器都需要执行一段现代JavaScript脚本,完成指定的工作量证明,以此向服务器证明“我是一个正常的浏览器用户”。这段计算在个人设备上可能只需要几十毫秒,负载完全可以忽略,但当同样的步骤被放大到数十万、数百万个并发请求时,爬虫的算力开销就会急剧攀升,变得又慢又贵。
这种“对个体宽容、对规模化恶意严苛”的设计,恰好击中了AI爬虫的软肋。爬虫的关键优势就是批量和高频,一旦每次抓取都要伴随一笔小小的算力“手续费”,哪怕单次成本低到不可思议,总量也会迅速变成一个天文数字。与此同时,普通用户依旧可以流畅进入网站,唯一的代价是在进站那一刻多等上零点几秒。如果浏览器禁用了现代JavaScript特性——比如安装了JShelter这类会拦截脚本的隐私插件——验证就会失败,页面将一直停留在“加载中”的状态。Anubis对此的提醒非常直白:要正常访问,就需要暂时为这个域名关掉相关插件。
眼下的工作量证明方案,在Anubis的设定里只是一个过渡手段。更长远的目标,是通过更精确的浏览器指纹技术来识别无头浏览器和自动化工具,比如分析字体渲染方式、WebGL渲染特征等差异。当这些指纹维度足够丰富时,服务器就可以在后台直接区分真实用户和爬虫,不再需要每次都弹出“验证”这道提示。只是在那一天到来之前,我们会越来越多地看到那个让你“证明你是人类”的进度条,而它也正在用一套极简的经济学思路,替人类用户收回一点点被机器挤占的访问空间。
热门跟贴