Cloudflare 昨天上线了一个新开关,名字叫“Disallow AI Training”。管理员打开它,搜索引擎照常抓取,但网站内容不再被拿去训练 AI。苹果、谷歌、微软已经承诺遵守这个设置。

混合爬虫怎么处理

打开网易新闻 查看精彩图片

这个设置不是一刀切。启用后,那些既做搜索又做 AI 训练的混合爬虫仍能抓取内容,前提是系统把它标记为“Accountable”,也就是可问责。其他纯粹用于 AI 训练的爬虫,会被直接拦在门外。

Cloudflare 也提醒了一句:拦截这类爬虫,有可能影响网站的搜索排名。这个取舍,管理员得自己掂量。

老用户不用动手

大多数客户不需要做任何更改。此前在 Training 选项里选了“Block”或“Block on pages with ads”的网站,会自动迁移到“Disallow AI Training”。换句话说,之前已经表态拒绝的站点,这次被系统默认接管了。

三家大厂的时间表

  • 谷歌:未来几周推出 Google-Extended 的 URL 层级透明度工具
  • 苹果:正在开发自己的 URL 层级工具
  • 微软:计划 2027 年初支持 robots.txt 拒绝 AI 训练

三家平台的动作节奏并不一致。谷歌和苹果都在做 URL 层级的透明度工具,意思是让网站能更细地看到哪些页面被抓了。微软则把支持 robots.txt 拒绝 AI 训练的时间点放到了 2027 年初。

对网站管理员来说,这个开关的意义在于:不用再在“被搜索收录”和“被 AI 白嫖”之间二选一。至少 Cloudflare 给出的方案,是让这两件事分开处理。