Аудит каталогу промислових інструментів із 5000 SKU показав, що Googlebot обходить URL-адреси фільтрів сайту тричі на день, тоді як основні сторінки категорій відвідуються лише раз на три тижні. Результат? Новим товарам знадобився місяць, щоб з'явитися в результатах пошуку, оскільки краулер застряг на малоцінних URL-адресах.
Чому фасетний пошук шкодить краулінговому бюджету
Фасетний пошук дозволяє покупцям звужувати результати за матеріалом, розміром, покриттям та іншими атрибутами. Кожен фасет додає параметр до URL-адреси, і при наявності п'яти вимірів кількість можливих комбінацій зростає до десятків тисяч унікальних сторінок. Більшість цих сторінок містять майже однаковий список товарів, проте Google розглядає кожну з них як окрему URL-адресу. Оскільки краулінговий бюджет Google — кількість сторінок, які він завантажує на сайті щодня — обмежений, він витрачає цінні слоти на URL-адреси, які приносять мало користі користувачам або пошуку.
Структура URL-адрес сайту заманює бота в «пастку для краулінгу» (crawl trap), де він нескінченно переходить за посиланнями, що ведуть на майже дубльовані сторінки.
Що стоїть на кону
- Швидкість індексації — затримка з виявлення означає, що нові запаси залишаються невидимими протягом тижнів, що шкодить продажам.
- Видимість у пошуку — якщо Google витрачає свій бюджет на сторінки фільтрів, пріоритетні сторінки товарів можуть ніколи не бути проскановані, що обмежує їхні шанси на ранжування.
Покрокова інструкція з відновлення краулінгового бюджету
Визначте важливі фасети
Знайдіть комбінації фільтрів, які генерують реальний пошуковий трафік. Надайте цим URL-адресам чистий, описовий шлях (наприклад,/end-mill/coating-tialn/). Зробіть такі сторінки повністю доступними для сканування та індексації.Використовуйте теги canonical для фасетів середньої важливості
Якщо фільтр є корисним, але має малий обсяг пошукових запитів, залиште URL-адресу доступною, але додайтеrel=canonical, що вказує на основну сторінку категорії. Це повідомить Google, що категорія є пріоритетною версією.Блокуйте малоцінні фасети через robots.txt
Заборонити ці шаблони вrobots.txt, щоб Googlebot ніколи не запитував їх.Відображайте розширені фільтри як кнопки, а не посилання
Боти переходять за елементами<a>, але ігнорують елементи<button>. Реалізуйте керування фільтрами за допомогою кнопок, які запускають JavaScript без створення нових URL-адрес. Користувачі отримають потрібний інтерфейс, а краулер не зможе знайти марні URL-адреси.Уникайте пастки «noindex»
Додаванняnoindexдо 30 000 URL-адрес фільтрів все одно змушує Google спочатку завантажити кожну сторінку, а потім прочитати директиву, щоб ігнорувати її. Використовуйтеrobots.txt, щоб повністю зупинити сканування; доступними мають бути лише ті сторінки, які ви плануєте індексувати.
Вимірювання успіху
Змістіть фокус із ранжування на швидкість індексації. Відстежуйте, скільки часу займає поява щойно доданого товару в індексі Google до та після впровадження змін. Скорочення затримки з 21 дня до 3 днів свідчить про те, що стратегія працює.
Контраргумент: зручність використання проти ефективності сканування
Зберігайте цілісність інтерфейсу — кнопки все одно дозволяють користувачам уточнювати результати — водночас робіть базові URL-адреси невидимими для краулера. Якщо певний фільтр є важливим для навігації, зробіть його важливим фасетом і надайте йому чисту URL-адресу, доступну для сканування.
На що звернути увагу далі
- Статистика сканування в Search Console — стежте за звітом «Crawl Stats», щоб побачити зменшення кількості «Requests blocked by robots.txt» та збільшення «Crawl depth» для сторінок товарів.
Висновок: Класифікуйте фасети, використовуйте теги canonical, блокуйте малоцінні URL-адреси та замінюйте посилання на кнопки. Великі інтернет-магазини можуть спрямовувати Googlebot на важливі сторінки, скорочуючи час індексації з тижнів до днів без втрати функціональності для покупців.
