Инженерная команда Wikimedia сообщает, что поисковые роботы на базе ИИ генерируют 65 % самого дорогостоящего трафика платформы, превращая безобидный на первый взгляд всплеск активности ботов в отдельную статью расходов в счетах за серверы. Та же тенденция сейчас наблюдается на крошечных блогах и любительских сайтах.

Почему этот всплеск важен

Люди-посетители задерживаются на популярных страницах — главных страницах, избранных статьях и другом известном контенте. CDN кэшируют эти страницы на периферийных узлах (edge locations), поэтому исходный сервер (origin server) редко берет на себя основную нагрузку. Поисковые роботы ИИ, напротив, сканируют тысячи малоизвестных URL за один проход. Эти страницы редко кэшируются, поэтому каждый запрос доходит до самой инфраструктуры Wikimedia. Результат: непропорционально высокий расход вычислительных мощностей, хранилища и сетевого трафика при относительно небольшой доле от общего объема трафика.

В инженерном блоге, опубликовавшем эти данные, отмечается, что хотя боты составляют лишь скромную часть от общего числа запросов, они доминируют в категории «дорогостоящих».

Кто страдает от этого

У мелких операторов нет такой «подушки безопасности». Скрытые издержки — это не только деньги; это также риск снижения производительности для реальных посетителей.

Что могут сделать владельцы сайтов

  • Начните с ограничения частоты запросов (rate-limiting) — ограничьте количество запросов, которые один IP-адрес может сделать за короткий промежуток времени. Это замедлит агрессивных роботов, не закрывая им доступ полностью.
  • Взвесьте видимость и затраты — блокировка поискового бота может сократить трафик, но это также может привести к исключению ваших страниц из индексов, что навредит органической доступности.
  • Классифицируйте ботов — не все роботы одинаковы. Некоторые относятся к легитимным поисковым инструментам, которые приносят трафик; другие — это обычные скреперы (scrapers), которые не приносят никакой пользы.
  • Внедрите задачи Proof-of-Work — требуйте решения небольшой вычислительной задачи перед выдачей страницы. Обычные пользователи решают её мгновенно, а ботам придется тратить дополнительные циклы процессора, что повысит их стоимость.
  • Используйте аналитику CDN — большинство CDN предоставляют метрики запросов по каждому боту. Определите, какие агенты чаще всего обращаются к исходному серверу, и настройте правила соответствующим образом.

Вывод прост: поисковые роботы ИИ больше не являются просто любопытным явлением, пользующимся чужими ресурсами; это измеримая статья расходов. Независимо от того, управляете ли вы глобальной энциклопедией или одностраничным портфолио, учет трафика ботов как отдельной статьи в бюджете инфраструктуры поможет избежать неожиданных счетов и обеспечит быструю работу вашего сайта для реальных пользователей.