对一个拥有 5,000 个 SKU 的工业工具目录进行审计时发现,Googlebot 每天会抓取该网站的筛选 URL 三次,而主分类页面每三周才被访问一次。结果如何?由于爬虫被困在低价值的 URL 上,新产品需要一个月才能出现在搜索结果中。
为什么分面搜索会损害抓取预算
分面搜索允许购物者通过材料、尺寸、涂层和其他属性来缩小搜索范围。每个分面都会为 URL 添加一个参数,如果拥有五个维度,可能的组合会爆炸式增长到数万个唯一的页面。其中大多数页面包含的产品列表几乎完全相同,但 Google 会将每一个都视为一个独立的 URL。由于 Google 的抓取预算(即它每天会在一个网站上抓取的页面数量)是有限的,它会将宝贵的配额浪费在那些对用户或搜索几乎没有价值的 URL 上。
该网站的 URL 结构将机器人引入了一个“抓取陷阱”,使其无休止地追踪指向近乎重复页面的链接。
风险所在
- 收录速度 – 发现延迟意味着新鲜的库存会数周处于不可见状态,从而影响销售。
- 搜索可见性 – 如果 Google 将其预算花在筛选页面上,高优先级的商品页面可能永远不会被抓取,从而限制了它们的排名机会。
夺回抓取预算的分步指南
识别高价值分面
找出能产生实际搜索流量的筛选组合。为这些 URL 提供清晰且具有描述性的路径(例如/end-mill/coating-tialn/)。确保高价值页面是完全可抓取且可收录的。对中等价值的分面使用 canonical 标签
当某个筛选器很有用但搜索量很小时,可以保持 URL 可访问,但添加一个指向主分类页面的rel=canonical标签。这会告诉 Google 该分类页面才是首选版本。通过 robots.txt 屏蔽低价值分面
在robots.txt中禁用这些模式,这样 Googlebot 就永远不会请求它们。将高级筛选渲染为按钮,而非链接
机器人会追踪<a>元素,但会忽略<button>元素。将筛选控件设计为通过 JavaScript 触发的按钮,而不是创建新 URL。用户仍然可以获得所需的 UI,而爬虫则无法发现无用的 URL。避免“noindex”陷阱
即使为 30,000 个筛选 URL 添加noindex,仍会迫使 Google 先下载每个页面,然后再读取指令将其忽略。请使用robots.txt完全停止抓取;只有你打算收录的页面才应该是可访问的。
衡量成功
将关注点从排名转向收录速度。跟踪在实施更改前后,新添加的产品出现在 Google 索引中所需的时间。如果延迟从 21 天缩短到 3 天,则说明该策略正在发挥作用。
权衡:用户体验与抓取效率
保持 UI 的完整性——按钮仍然可以让用户细化结果——同时让底层的 URL 对爬虫不可见。如果某个特定筛选器对导航至关重要,请将其提升为高价值分面,并为其提供清晰、可抓取的 URL。
后续关注点
- Search Console 抓取统计数据 – 监控“抓取统计信息”报告,观察“被 robots.txt 拦截的请求”是否减少,以及产品页面的“抓取深度”是否增加。
核心总结: 对分面进行分类,使用 canonical 标签,屏蔽低价值 URL,并将链接替换为按钮。大型电子商务网站可以将 Googlebot 引导至重要的页面,在不牺牲购物者功能的前提下,将收录时间从数周缩短至数天。
