一个网站不需要庞大的内容库,就能制造出海量URL。产品筛选、排序选项、分页和本地化版本,会把Googlebot可爬取的路径成倍放大,消耗服务器资源,还可能拖慢重要新页面的发现速度。Google针对分面导航更新的指南,给了站长一个更清晰的判断框架:哪些URL组合应该可爬,哪些不该。

核心问题不在于分面导航本身有害。筛选对访客有用,某些情况下筛选页也可能是有效的搜索落地页。风险出现在每一种可能的组合都生成一个可爬URL时,包括空结果、重复结果或毫无意义的结果。Google在12月发布的官方抓取指南中解释,爬取这些URL会占用大量服务器资源,并延迟新内容的发现。

打开网易新闻 查看精彩图片

对站长来说,实际任务是划出一条明确的边界:保留服务用户或搜索需求的URL,同时阻止低价值组合扩大可爬表面。

URL膨胀从哪来

分面导航让访客通过类目、尺寸、价格、颜色或库存等属性缩小目录或列表范围。每个筛选器可以生成一个URL,筛选器的组合又会生成更多。再加上排序和页码参数,一个规模并不大的目录,暴露出的可爬URL数量会远超其产品或文章数量。

Google给出了分面URL的两大类处理思路。这个区分很重要,因为robots.txt和片段与规范化扮演的角色不同。屏蔽非必要URL有助于限制抓取;当相似URL必须保持可访问、可爬取时,规范化有助于整合信号。canonical标签不能替代一个更前置的决定:无限多的筛选组合,究竟该不该作为抓取目标存在。

Google的文档还点出了一些在规模上影响会被放大的细节:

  • 参数分隔符应使用&符号
  • 参数顺序应保持一致,避免同一组已选筛选器以多种URL顺序出现
  • 空结果页应返回404状态,而不是把用户和爬虫重定向到不相关的页面
  • rel canonical和rel nofollow可以作为策略性工具,用来管理抓取行为

分页会带来更多待审URL

分页和分面导航不是一回事,但它会叠加同一个抓取管理问题。当筛选和排序选项存在时,一个多页类目会变成多个多页类目。结果就是一个分层的URL空间:筛选组合、页码,有时还有语言或地区变体。

有用的问题不是某个页码是否存在,而是由此产生的路径是否内部一致、是否指向有意义的内容。站长应该先梳理对访客真正重要的主要列表路径,然后查找重复的参数模式、空页面,以及几乎或完全不产生价值的“筛选加页码”组合。这样能把审查聚焦在真实的URL行为上,而不是只看网站表面的大小。

语言版本需要清晰的地区信号

多语言或多地区网站引入了另一个URL膨胀来源,因为同一份内容可能存在于多个语言或地区版本中。Google记录了三种告知本地化版本的方式:HTML hreflang链接、HTTP标头和XML站点地图。

无论网站采用哪种实现方式,Google的指南都强调双向链接、x-default兜底,以及各版本之间实现的一致性。这些信号帮助Google理解等价本地化页面之间的关系,但它们并不能免除保持网站URL架构连贯的必要。对用户有价值的语言版本可能值得抓取,而每个地区内多余的参数变体则未必。

一份实用的抓取管理检查清单

一次有用的审查,从网站自身暴露的URL模式开始。把导航链接、筛选控件、分页和本地化页面标注放在一起看,而不是把每一项当作孤立的技术功能。

  1. 哪些筛选组合是有意设计为可爬取、并可能被索引的
  2. 同一组筛选器是否因为参数顺序变化而生成多个URL
  3. 空结果或无意义组合是否返回404,而不是重定向到别处
  4. 非必要筛选URL是否通过所选方式被阻止抓取
  5. 可爬的筛选URL在需要整合信号时是否使用了规范化
  6. 本地化版本是否一致地使用Google支持的某种信号方式,并配有互链和适用的x-default

这也是一个把访客体验与搜索爬虫行为分开的机会。一个筛选器即使URL不该成为抓取目标,它在界面上仍然可以保持有用。反过来,当一组精心挑选的稳定筛选页确实服务于有意义的目的时,也可以把它们保留下来。

庞大的URL空间会让人更难看清:重要页面是否被高效发现,重复变体是否在搜索中相互竞争。Scalevise可以评估你网站的筛选器、本地化页面和抓取信号如何契合更广泛的搜索策略,然后优先安排实际修复,在减少无效消耗的同时不隐藏有价值的内容。与Scalevise聊聊AI与搜索策略咨询,把抓取发现转化为一份聚焦的实施计划。

常见问题

为什么分面导航会影响Googlebot抓取?每个筛选器和筛选器组合都可能生成一个独立URL。Google表示,爬取分面URL会……