Het engineeringteam van Wikimedia meldt dat door AI aangedreven crawlers 65% van het duurste verkeer van het platform veroorzaken, waardoor een onschuldig ogende piek in botverkeer een kostenpost op de serverrekeningen wordt. Dezelfde trend is nu ook zichtbaar op kleine blogs en hobbywebsites.
Waarom deze piek belangrijk is
Menselijke bezoekers blijven langer op populaire pagina's — homepages, uitgelichte artikelen en andere bekende content. CDNs cachen deze pagina's op edge-locaties, waardoor de origin-server zelden zwaar werk hoeft te verrichten. AI-crawlers scrapen daarentegen duizenden obscure URL's in één enkele run. Deze pagina's worden zelden gecached, waardoor elke aanvraag helemaal terug moet naar de origin-infrastructuur van Wikimedia. Het resultaat: een onevenredig grote hoeveelheid rekenkracht, opslag en netwerkgebruik voor een relatief klein deel van het totale verkeer.
De engineeringblog die de gegevens heeft vrijgegeven, merkt op dat hoewel bots slechts een bescheiden fractie van het totale aantal aanvragen uitmaken, ze de "kostbare" categorie domineren.
Wie de dupe is
Kleinere exploitanten missen die buffer. De verborgen kosten zijn niet alleen financieel; het brengt ook het risico met zich mee dat de prestaties voor legitieme bezoekers verslechteren.
Wat site-eigenaren kunnen doen
- Begin met rate-limiting – beperk het aantal aanvragen dat een enkel IP-adres binnen een korte periode kan doen. Dit vertraagt agressieve crawlers zonder de toegang volledig te ontzeggen.
- Weeg zichtbaarheid af tegen kosten – het blokkeren van een zoekmachinebot kan het verkeer verminderen, maar het kan je pagina's ook uit indexen verwijderen, wat de organische vindbaarheid schaadt.
- Classificeer de bots – niet alle crawlers zijn gelijk. Sommige behoren tot legitieme zoektools die verkeer genereren; andere zijn pure scrapers die geen waarde toevoegen.
- Implementeer proof-of-work-uitdagingen – vereis een kleine computationele puzzel voordat een pagina wordt geserveerd. Menselijke browsers lossen dit direct op; bots moeten extra rekenkracht verbruiken, wat hun kosten verhoogt.
- Gebruik CDN-analyse – de meeste CDNs bieden statistieken per bot aan. Identificeer welke agents het vaakst de origin benaderen en pas de regels daarop aan.
De conclusie is simpel: AI-crawlers zijn niet langer een onschuldige nieuwigheid; ze zijn een meetbare kostenpost. Of je nu een wereldwijde encyclopedie beheert of een portfolio op één pagina, het behandelen van botverkeer als een post in je infrastructuurbudget kan verrassende rekeningen voorkomen en je site responsief houden voor echte gebruikers.
