El equipo de ingeniería de Wikimedia afirma que los rastreadores impulsados por IA generan el 65 % del tráfico más costoso de la plataforma, convirtiendo lo que parece un aumento inofensivo de bots en una partida específica en las facturas de los servidores. El mismo patrón aparece ahora en blogs pequeños y sitios de aficionados.
Por qué este aumento es importante
Los visitantes humanos pasan tiempo en páginas populares: páginas de inicio, artículos destacados y otros contenidos conocidos. Las CDN almacenan esas páginas en caché en ubicaciones de borde (edge locations), por lo que el servidor de origen rara vez realiza un trabajo pesado. Por el contrario, los rastreadores de IA extraen miles de URLs poco conocidas en una sola ejecución. Esas páginas rara vez están en caché, por lo que cada solicitud viaja hasta la infraestructura de origen de Wikimedia. El resultado: una cantidad desproporcionada de uso de cómputo, almacenamiento y red para una porción relativamente pequeña del tráfico total.
El blog de ingeniería que publicó los datos señala que, si bien los bots representan solo una fracción modesta del total de las solicitudes, dominan el grupo de las "costosas".
Quién sufre las consecuencias
Los operadores más pequeños carecen de ese colchón. El coste oculto no es solo dinero; también conlleva el riesgo de un rendimiento degradado para los visitantes legítimos.
Qué pueden hacer los propietarios de sitios
- Empezar con la limitación de tasa (rate-limiting) – restringir el número de solicitudes que una sola IP puede realizar en un intervalo corto. Esto ralentiza a los rastreadores agresivos sin denegarles el acceso por completo.
- Sopesar la visibilidad frente al coste – bloquear un bot de un motor de búsqueda puede reducir el tráfico, pero también puede hacer que tus páginas desaparezcan de los índices, perjudicando la capacidad de ser descubierto de forma orgánica.
- Clasificar los bots – no todos los rastreadores son iguales. Algunos pertenecen a herramientas de búsqueda legítimas que atraen tráfico; otros son simples extractores de datos (scrapers) que no aportan ningún valor.
- Implementar desafíos de prueba de trabajo (proof-of-work) – requerir un pequeño acertijo computacional antes de servir una página. Los navegadores humanos lo resuelven al instante; los bots deben gastar ciclos adicionales, lo que aumenta su coste.
- Utilizar analíticas de CDN – la mayoría de las CDN muestran métricas de solicitudes por bot. Identifica qué agentes acceden al origen con más frecuencia y adapta las reglas en consecuencia.
La conclusión es sencilla: los rastreadores de IA ya no son una curiosidad que aprovecha recursos ajenos; son un centro de costes mensurable. Ya sea que gestiones una enciclopedia global o un portafolio de una sola página, tratar el tráfico de bots como una partida en tu presupuesto de infraestructura puede evitar facturas sorpresa y mantener la agilidad de tu sitio para los usuarios reales.
