Das Engineering-Team von Wikimedia gibt an, dass KI-gesteuerte Crawler 65 % des teuersten Traffics der Plattform verursachen und so einen harmlos aussehenden Bot-Anstieg in einen festen Posten auf den Serverrechnungen verwandeln. Dasselbe Muster zeigt sich nun auch bei kleinen Blogs und Hobby-Websites.

Warum dieser Anstieg wichtig ist

Menschliche Besucher verweilen auf populären Seiten – Startseiten, hervorgehobene Artikel und andere bekannte Inhalte. CDNs cachen diese Seiten an Edge-Standorten, sodass der Origin-Server selten die Hauptarbeit leisten muss. KI-Crawler hingegen scrapen in einem einzigen Durchlauf tausende obskure URLs. Diese Seiten werden selten gecacht, weshalb jede Anfrage bis zur Origin-Infrastruktur von Wikimedia zurückreisen muss. Das Ergebnis: ein unverhältnismäßig hoher Anteil an Rechen-, Speicher- und Netzwerkressourcen für einen relativ kleinen Teil des gesamten Traffics.

Der Engineering-Blog, der die Daten veröffentlicht hat, merkt an, dass Bots zwar nur einen bescheidenen Bruchteil der Gesamtanfragen ausmachen, aber den Bereich der „kostspieligen“ Anfragen dominieren.

Wer die Auswirkungen spürt

Kleinere Betreiber verfügen nicht über diesen Puffer. Die versteckten Kosten sind nicht nur finanzieller Natur; sie bergen auch das Risiko einer verschlechterten Performance für legitime Besucher.

Was Website-Betreiber tun können

  • Beginnen Sie mit Rate-Limiting – drosseln Sie die Anzahl der Anfragen, die eine einzelne IP in einem kurzen Zeitraum stellen kann. Dies verlangsamt aggressive Crawler, ohne ihnen den Zugriff komplett zu verweigern.
  • Wägen Sie Sichtbarkeit gegen Kosten ab – das Blockieren eines Suchmaschinen-Bots mag zwar den Traffic reduzieren, kann aber auch dazu führen, dass Ihre Seiten aus den Indizes verschwinden, was die organische Auffindbarkeit beeinträchtigt.
  • Klassifizieren Sie die Bots – nicht alle Crawler sind gleich. Einige gehören zu legitimen Suchwerkzeugen, die Traffic bringen; andere sind reine Scraper, die keinen Mehrwert bieten.
  • Setzen Sie Proof-of-Work-Challenges ein – verlangen Sie ein kleines Rechenrätsel, bevor eine Seite ausgeliefert wird. Menschliche Browser lösen es sofort; Bots müssen zusätzliche Rechenzyklen aufwenden, was ihre Kosten erhöht.
  • Nutzen Sie CDN-Analysen – die meisten CDNs bieten Metriken zu Anfragen pro Bot an. Identifizieren Sie, welche Agenten den Origin am häufigsten kontaktieren, und passen Sie Ihre Regeln entsprechend an.

Das Fazit ist einfach: KI-Crawler sind keine bloße Kuriosität mehr, die sich umsonst bedient; sie sind ein messbarer Kostenfaktor. Egal, ob Sie eine globale Enzyklopädie oder ein einseitiges Portfolio betreiben – Bot-Traffic als festen Posten in Ihrem Infrastrukturbudget zu behandeln, kann Überraschungsrechnungen verhindern und sicherstellen, dass Ihre Website für echte Nutzer reaktionsschnell bleibt.