L'équipe d'ingénierie de Wikimedia affirme que les robots d'indexation (crawlers) alimentés par l'IA génèrent 65 % du trafic le plus coûteux de la plateforme, transformant une hausse de bots d'apparence inoffensive en un poste de dépense sur les factures de serveurs. Le même schéma apparaît désormais sur de petits blogs et des sites de loisirs.

Pourquoi cette hausse est importante

Les visiteurs humains s'attardent sur les pages populaires — pages d'accueil, articles à la une et autres contenus connus. Les CDN mettent ces pages en cache dans des emplacements de proximité (edge), de sorte que le serveur d'origine effectue rarement un travail intensif. À l'inverse, les robots d'indexation IA extraient des milliers d'URL obscures en une seule passe. Ces pages sont rarement mises en cache, chaque requête doit donc remonter jusqu'à l'infrastructure d'origine de Wikimedia. Résultat : une utilisation disproportionnée des ressources de calcul, de stockage et de réseau pour une part relativement faible du trafic total.

Le blog d'ingénierie qui a publié ces données note que, bien que les bots ne représentent qu'une fraction modeste de l'ensemble des requêtes, ils dominent la catégorie des requêtes « coûteuses ».

Qui en subit les conséquences

Les petits exploitants n'ont pas ce coussin de sécurité. Le coût caché n'est pas seulement financier ; il risque également de dégrader les performances pour les visiteurs légitimes.

Que peuvent faire les propriétaires de sites

  • Commencer par la limitation de débit (rate-limiting) – restreindre le nombre de requêtes qu'une seule adresse IP peut effectuer dans un intervalle de temps court. Cela ralentit les robots agressifs sans pour autant leur refuser l'accès.
  • Évaluer le rapport visibilité/coût – bloquer un robot de moteur de recherche peut réduire le trafic, mais cela peut aussi faire disparaître vos pages des index, nuisant ainsi à votre découvrabilité organique.
  • Classifier les bots – tous les robots d'indexation ne se valent pas. Certains appartiennent à des outils de recherche légitimes qui apportent du trafic ; d'autres sont de simples scrapers qui n'apportent aucune valeur ajoutée.
  • Déployer des défis de preuve de travail (proof-of-work) – exiger la résolution d'une petite énigme informatique avant de servir une page. Les navigateurs humains la résolvent instantanément ; les bots doivent dépenser des cycles de calcul supplémentaires, ce qui augmente leur coût.
  • Utiliser les analyses CDN – la plupart des CDN fournissent des métriques de requêtes par bot. Identifiez quels agents sollicitent l'origine le plus souvent et adaptez vos règles en conséquence.

La conclusion est simple : les robots d'indexation IA ne sont plus une curiosité qui profite gratuitement du système ; ils constituent un centre de coûts mesurable. Que vous gériez une encyclopédie mondiale ou un simple portfolio d'une page, traiter le trafic des bots comme un poste de dépense dans votre budget d'infrastructure peut éviter les factures surprises et maintenir la réactivité de votre site pour les utilisateurs réels.