Аудит каталогу промислових інструментів із 5000 SKU показав, що Googlebot обходить URL-адреси фільтрів сайту тричі на день, тоді як основні сторінки категорій відвідуються лише раз на три тижні. Результат? Новим товарам знадобився місяць, щоб з'явитися в результатах пошуку, оскільки краулер застряг на малоцінних URL-адресах.

Чому фасетний пошук шкодить краулінговому бюджету

Фасетний пошук дозволяє покупцям звужувати результати за матеріалом, розміром, покриттям та іншими атрибутами. Кожен фасет додає параметр до URL-адреси, і при наявності п'яти вимірів кількість можливих комбінацій зростає до десятків тисяч унікальних сторінок. Більшість цих сторінок містять майже однаковий список товарів, проте Google розглядає кожну з них як окрему URL-адресу. Оскільки краулінговий бюджет Google — кількість сторінок, які він завантажує на сайті щодня — обмежений, він витрачає цінні слоти на URL-адреси, які приносять мало користі користувачам або пошуку.

Структура URL-адрес сайту заманює бота в «пастку для краулінгу» (crawl trap), де він нескінченно переходить за посиланнями, що ведуть на майже дубльовані сторінки.

Що стоїть на кону

  • Швидкість індексації — затримка з виявлення означає, що нові запаси залишаються невидимими протягом тижнів, що шкодить продажам.
  • Видимість у пошуку — якщо Google витрачає свій бюджет на сторінки фільтрів, пріоритетні сторінки товарів можуть ніколи не бути проскановані, що обмежує їхні шанси на ранжування.

Покрокова інструкція з відновлення краулінгового бюджету

  1. Визначте важливі фасети
    Знайдіть комбінації фільтрів, які генерують реальний пошуковий трафік. Надайте цим URL-адресам чистий, описовий шлях (наприклад, /end-mill/coating-tialn/). Зробіть такі сторінки повністю доступними для сканування та індексації.

  2. Використовуйте теги canonical для фасетів середньої важливості
    Якщо фільтр є корисним, але має малий обсяг пошукових запитів, залиште URL-адресу доступною, але додайте rel=canonical, що вказує на основну сторінку категорії. Це повідомить Google, що категорія є пріоритетною версією.

  3. Блокуйте малоцінні фасети через robots.txt
    Заборонити ці шаблони в robots.txt, щоб Googlebot ніколи не запитував їх.

  4. Відображайте розширені фільтри як кнопки, а не посилання
    Боти переходять за елементами <a>, але ігнорують елементи <button>. Реалізуйте керування фільтрами за допомогою кнопок, які запускають JavaScript без створення нових URL-адрес. Користувачі отримають потрібний інтерфейс, а краулер не зможе знайти марні URL-адреси.

  5. Уникайте пастки «noindex»
    Додавання noindex до 30 000 URL-адрес фільтрів все одно змушує Google спочатку завантажити кожну сторінку, а потім прочитати директиву, щоб ігнорувати її. Використовуйте robots.txt, щоб повністю зупинити сканування; доступними мають бути лише ті сторінки, які ви плануєте індексувати.

Вимірювання успіху

Змістіть фокус із ранжування на швидкість індексації. Відстежуйте, скільки часу займає поява щойно доданого товару в індексі Google до та після впровадження змін. Скорочення затримки з 21 дня до 3 днів свідчить про те, що стратегія працює.

Контраргумент: зручність використання проти ефективності сканування

Зберігайте цілісність інтерфейсу — кнопки все одно дозволяють користувачам уточнювати результати — водночас робіть базові URL-адреси невидимими для краулера. Якщо певний фільтр є важливим для навігації, зробіть його важливим фасетом і надайте йому чисту URL-адресу, доступну для сканування.

На що звернути увагу далі

  • Статистика сканування в Search Console — стежте за звітом «Crawl Stats», щоб побачити зменшення кількості «Requests blocked by robots.txt» та збільшення «Crawl depth» для сторінок товарів.

Висновок: Класифікуйте фасети, використовуйте теги canonical, блокуйте малоцінні URL-адреси та замінюйте посилання на кнопки. Великі інтернет-магазини можуть спрямовувати Googlebot на важливі сторінки, скорочуючи час індексації з тижнів до днів без втрати функціональності для покупців.