Аудит каталога промышленных инструментов с 5 000 SKU показал, что Googlebot обходит URL-адреса фильтров трижды в день, в то время как основные страницы категорий посещаются лишь раз в три недели. Результат? Новым товарам требовался месяц, чтобы появиться в результатах поиска, так как краулер застревал на низкоценных URL.
Почему фасетный поиск вредит краулинговому бюджету
Фасетный поиск позволяет покупателям сужать результаты по материалу, размеру, покрытию и другим атрибутам. Каждый фасет добавляет параметр в URL, и при наличии пяти измерений количество возможных комбинаций взрывообразно растет, достигая десятков тысяч уникальных страниц. Большинство этих страниц содержат почти один и тот же список товаров, однако Google рассматривает каждую из них как отдельный URL. Поскольку краулинговый бюджет Google — количество страниц, которые он обходит на сайте ежедневно — ограничен, он тратит драгоценные ресурсы на URL, которые приносят мало пользы пользователям или поиску.
Структура URL сайта заманивает бота в «краулинговую ловушку», где он бесконечно переходит по ссылкам, ведущим на почти дублирующие друг друга страницы.
Что стоит на кону
- Скорость индексации — задержка обнаружения означает, что новые поступления остаются невидимыми неделями, что бьет по продажам.
- Видимость в поиске — если Google тратит бюджет на страницы фильтров, высокоприоритетные страницы товаров могут никогда не быть просканированы, что ограничивает их шансы на ранжирование.
Пошаговое руководство по возврату краулингового бюджета
Определите высокоценные фасеты
Найдите комбинации фильтров, которые генерируют реальный поисковый трафик. Присвойте этим URL чистые, описательные пути (например,/end-mill/coating-tialn/). Сделайте высокоценные страницы полностью доступными для сканирования и индексации.Используйте теги canonical для фасетов средней ценности
Если фильтр полезен, но имеет небольшой объем поиска, оставьте URL доступным, но добавьтеrel=canonical, указывающий на основную страницу категории. Это сообщит Google, что категория является предпочтительной версией.Блокируйте низкоценные фасеты через robots.txt
Запретите эти паттерны вrobots.txt, чтобы Googlebot никогда не запрашивал их.Рендерите расширенные фильтры как кнопки, а не ссылки
Боты переходят по элементам<a>, но игнорируют элементы<button>. Реализуйте управление фильтрами в виде кнопок, которые запускают JavaScript без создания новых URL. Пользователи по-прежнему получают нужный интерфейс, а краулер не может обнаружить бесполезные URL.Избегайте ловушки «noindex»
Добавлениеnoindexк 30 000 URL-адресов фильтров все равно заставляет Google сначала загрузить каждую страницу, а затем прочитать директиву об игнорировании. Используйтеrobots.txt, чтобы полностью остановить сканирование; достижимыми должны быть только те страницы, которые вы намерены индексировать.
Измерение успеха
Сместите фокус с позиций на скорость индексации. Отслеживайте, сколько времени требуется новому товару, чтобы появиться в индексе Google, до и после внесенных изменений. Переход от 21-дневной задержки к 3-дневной доказывает, что стратегия работает.
Контраргумент: удобство использования против эффективности сканирования
Сохраняйте интерфейс неизменным — кнопки по-прежнему позволяют пользователям уточнять результаты — при этом делая базовые URL невидимыми для краулера. Если какой-то конкретный фильтр окажется необходимым для навигации, повысьте его статус до высокоценного фасета и дайте ему чистый, доступный для сканирования URL.
На что обратить внимание в дальнейшем
- Статистика сканирования в Search Console — следите за отчетом «Crawl Stats» на предмет сокращения количества «Requests blocked by robots.txt» и увеличения «Crawl depth» для страниц товаров.
Вывод: Классифицируйте фасеты, используйте теги canonical, блокируйте низкоценные URL и заменяйте ссылки кнопками. Крупные сайты электронной коммерции могут направлять Googlebot на важные страницы, сокращая время индексации с недель до дней без ущерба для функциональности покупателей.
