Zespół inżynieryjny Wikimedia twierdzi, że roboty indeksujące napędzane przez AI generują 65% najdroższego ruchu na platformie, zmieniając pozornie nieszkodliwy wzrost liczby botów w konkretną pozycję na rachunkach za serwery. Ten sam schemat pojawia się obecnie na małych blogach i stronach hobbystycznych.
Dlaczego ten wzrost jest istotny
Ludzie spędzają czas na popularnych stronach – stronach głównych, artykułach wyróżnionych i innych znanych treściach. Sieci CDN przechowują te strony w pamięci podręcznej w lokalizacjach brzegowych, dzięki czemu serwer źródłowy rzadko wykonuje ciężką pracę. Roboty AI, w przeciwieństwie do nich, przeszukują tysiące mało znanych adresów URL podczas jednego cyklu. Te strony rzadko są buforowane, więc każde zapytanie trafia bezpośrednio do infrastruktury źródłowej Wikimedia. Rezultatem jest nieproporcjonalnie duże zużycie mocy obliczeniowej, pamięci masowej i sieci w stosunku do stosunkowo małego udziału w całkowitym ruchu.
Blog inżynieryjny, który opublikował te dane, zauważa, że choć boty stanowią jedynie skromną część wszystkich zapytań, dominują w kategorii „kosztownych”.
Kto odczuwa skutki
Mniejsi operatorzy nie mają takiej poduszki finansowej. Ukrytym kosztem nie są tylko pieniądze; istnieje również ryzyko pogorszenia wydajności dla prawdziwych użytkowników.
Co mogą zrobić właściciele stron
- Zacznij od ograniczania liczby żądań (rate-limiting) – ogranicz liczbę zapytań, jakie pojedynczy adres IP może wysłać w krótkim czasie. To spowalnia agresywne roboty bez całkowitego odcinania im dostępu.
- Rozważ widoczność w stosunku do kosztów – zablokowanie bota wyszukiwarki może zmniejszyć ruch, ale może również spowodować usunięcie Twoich stron z indeksów, co zaszkodzi organicznej wykrywalności.
- Klasyfikuj boty – nie wszystkie roboty są takie same. Niektóre należą do legalnych narzędzi wyszukiwania, które generują ruch; inne to zwykłe skrapery, które nie wnoszą żadnej wartości.
- Wdróż wyzwania typu proof-of-work – wymagaj rozwiązania małej zagadki obliczeniowej przed wyświetleniem strony. Ludzkie przeglądarki rozwiązują ją natychmiast; boty muszą zużyć dodatkowe cykle procesora, co podnosi ich koszt.
- Korzystaj z analityki CDN – większość sieci CDN udostępnia metryki zapytań dla poszczególnych botów. Zidentyfikuj, które agenty najczęściej uderzają w serwer źródłowy i odpowiednio dostosuj reguły.
Wniosek jest prosty: roboty AI nie są już tylko ciekawostką korzystającą z cudzych zasobów za darmo; są mierzalnym centrum kosztów. Niezależnie od tego, czy prowadzisz globalną encyklopedię, czy jednopaginowe portfolio, traktowanie ruchu botów jako pozycji w budżecie na infrastrukturę może zapobiec niespodziewanym rachunkom i zapewnić responsywność Twojej strony dla prawdziwych użytkowników.
