Інженерна команда Wikimedia заявляє, що роботи на базі ШІ генерують 65 % найдорожчого трафіку платформи, перетворюючи на перший погляд нешкідливий сплеск ботів на окрему статтю у рахунках за сервери. Те саме спостерігається зараз і на маленьких блогах та хобі-сайтах.

Чому цей сплеск має значення

Люди-відвідувачі затримуються на популярних сторінках — головних сторінках, вибраних статтях та іншому відомому контенті. CDN кешують ці сторінки на периферійних вузлах (edge locations), тому основний сервер (origin server) рідко виконує важку роботу. Натомість ШІ-краулери за один прохід збирають дані з тисяч маловідомих URL-адрес. Ці сторінки рідко кешуються, тому кожен запит доходить аж до основної інфраструктури Wikimedia. Результат: непропорційно великий обсяг обчислювальних ресурсів, сховищ та мережевого трафіку при відносно невеликій частці загального трафіку.

В інженерному блозі, де було опубліковано ці дані, зазначається, що хоча боти становлять лише скромну частку від загальної кількості запитів, вони домінують у категорії «дорогих» запитів.

Хто відчуває цей біль

Меншим операторам бракує такого «запобіжника». Приховані витрати — це не лише гроші; це також ризик погіршення продуктивності для реальних відвідувачів.

Що можуть зробити власники сайтів

  • Почніть із обмеження частоти запитів (rate-limiting) — обмежте кількість запитів, які одна IP-адреса може зробити за короткий проміжок часу. Це сповільнить агресивних краулерів, не блокуючи їм доступ повністю.
  • Зважуйте видимість і витрати — блокування бота пошукової системи може зменшити трафік, але це також може призвести до виключення ваших сторінок з індексів, що зашкодить органічній видимості.
  • Класифікуйте ботів — не всі краулери однакові. Деякі належать до легітимних інструментів пошуку, які приносять трафік; інші є звичайними скреперами (scrapers), які не приносять жодної користі.
  • Впроваджуйте завдання proof-of-work — вимагайте розв'язання невеликої обчислювальної головоломки перед наданням доступу до сторінки. Люди-користувачі вирішують її миттєво; ботам же доведеться витрачати додаткові цикли, що підвищує їхню вартість.
  • Використовуйте аналітику CDN — більшість CDN надають метрики запитів для кожного окремого бота. Визначте, які агенти найчастіше звертаються до основного сервера, і відповідно налаштуйте правила.

Висновок простий: ШІ-краулери — це вже не просто цікава аномалія, яка користується вашими ресурсами безкоштовно; це відчутний центр витрат. Незалежно від того, чи керуєте ви глобальною енциклопедією, чи односторінковим портфоліо, ставлення до трафіку ботів як до окремої статті у бюджеті на інфраструктуру допоможе уникнути несподіваних рахунків і збереже швидкість роботи вашого сайту для реальних користувачів.