Wikimedia의 엔지니어링 팀에 따르면 AI 기반 크롤러가 플랫폼에서 가장 비용이 많이 드는 트래픽의 65%를 생성하고 있으며, 이는 무해해 보이는 봇 급증을 서버 청구서의 구체적인 비용 항목으로 만들고 있습니다. 동일한 패턴이 이제 작은 블로그와 취미 사이트에서도 나타나고 있습니다.
급증이 중요한 이유
실제 방문자는 홈페이지, 주요 문서 및 기타 잘 알려진 콘텐츠와 같은 인기 페이지에 머무릅니다. CDN은 이러한 페이지를 에지(edge) 위치에 캐싱하므로 오리진 서버가 과도한 작업을 수행하는 경우는 드뭅니다. 반면, AI 크롤러는 한 번의 실행으로 수천 개의 모호한 URL을 스크래핑합니다. 이러한 페이지는 캐싱되는 경우가 거의 없으므로, 모든 요청이 Wikimedia의 오리진 인프라까지 직접 전달됩니다. 그 결과, 전체 트래픽 중 차지하는 비중은 상대적으로 작음에도 불구하고 컴퓨팅, 스토리지 및 네트워크 사용량이 불균형적으로 증가하게 됩니다.
데이터를 공개한 엔지니어링 블로그는 봇이 전체 요청에서 차지하는 비중은 미미하지만, "비용이 많이 드는" 영역을 독점하고 있다고 언급했습니다.
누가 피해를 입는가
규모가 작은 운영자들은 이러한 완충 장치가 부족합니다. 숨겨진 비용은 단순히 돈뿐만이 아닙니다. 정당한 방문자들의 성능 저하를 초래할 위험도 있습니다.
사이트 소유자가 할 수 있는 일
- 속도 제한(rate-limiting)부터 시작하기 – 짧은 시간 동안 단일 IP가 보낼 수 있는 요청 수를 제한합니다. 이는 접근을 완전히 차단하지 않으면서도 공격적인 크롤러의 속도를 늦춥니다.
- 가시성과 비용 사이의 균형 맞추기 – 검색 엔진 봇을 차단하면 트래픽을 줄일 수 있지만, 페이지가 인덱스에서 제외되어 유기적 검색 노출(organic discoverability)에 타격을 줄 수도 있습니다.
- 봇 분류하기 – 모든 크롤러가 동일한 것은 아닙니다. 어떤 봇은 트래픽을 유도하는 정당한 검색 도구인 반면, 어떤 봇은 아무런 가치를 더하지 않는 단순 스크래퍼입니다.
- 작업 증명(proof-of-work) 챌린지 도입하기 – 페이지를 제공하기 전에 작은 계산 퍼즐을 요구합니다. 일반 브라우저는 이를 즉시 해결하지만, 봇은 추가적인 연산 자원을 소모해야 하므로 비용이 상승하게 됩니다.
- CDN 분석 활용하기 – 대부분의 CDN은 봇별 요청 메트릭을 제공합니다. 어떤 에이전트가 오리진에 가장 자주 접속하는지 식별하고 그에 따라 규칙을 조정하십시오.
결론은 간단합니다. AI 크롤러는 더 이상 단순한 호기심의 대상이 아니라, 측정 가능한 비용 발생원입니다. 글로벌 백과사전을 운영하든 단일 페이지 포트폴리오를 운영하든, 봇 트래픽을 인프라 예산의 한 항목으로 취급하면 예상치 못한 청구서를 방지하고 실제 사용자에게 사이트 응답성을 유지할 수 있습니다.
