Cloudflare, 이번 9월부터 AI 에이전트 크롤러 기본 차단 예정
인공지능에 의한 무분별한 웹 스크래핑의 시대가 저물고 있습니다. 9월 15일부터 Cloudflare는 AI 에이전트 크롤러를 기본적으로 차단하는 중대한 정책 변화를 시행하며, 이를 통해 허가 기반의 데이터 접근이라는 새로운 시대를 열게 됩니다.
수동적 스크래핑에서 능동적 허가로의 전환
수년간 AI 모델과 자율 에이전트는 공개된 웹을 탐색하고 데이터를 스크래핑하여 사용자에게 실시간 답변을 제공하는 방식으로 작동해 왔습니다. 하지만 최근 Cloudflare의 발표는 웹 인프라가 이러한 '에이전트형(agentic)' 봇을 처리하는 방식에 있어 중대한 전환점을 시사합니다. 검색 결과 제공을 위해 페이지를 인덱싱하는 기존의 검색 엔진 크롤러와 달리, AI 에이전트 크롤러는 사용자를 대신해 특정 작업을 수행하거나 복잡한 질문에 답하기 위해 실시간으로 콘텐츠를 가져옵니다.
9월 15일부터 Cloudflare로 보호되는 웹의 상당 부분이 이러한 에이전트들을 자동으로 제한하게 됩니다. 이번 조치는 웹사이트 소유자와 발행인이 자신의 독점 데이터와 창작 콘텐츠가 거대 언어 모델(LLM) 및 자율 에이전트에 의해 어떻게 수집되는지에 대해 더 많은 통제권을 가질 수 있도록 설계되었습니다. 웹은 이제 누구나 자유롭게 가져가는 방식에서, 봇이 명시적으로 접근 권한을 요청해야 하는 '게이트형(gated)' 모델로 전환되고 있습니다.
개발자와 사이트 소유자가 접근 권한을 부여하는 방법
기본 설정은 제한적이지만, Cloudflare가 유익한 AI 도구의 기능을 망가뜨리는 것을 목표로 하는 것은 아닙니다. 대신, 크롤러와 호스트 사이에 구조화된 '핸드셰이크(handshake)'를 구축하는 것이 목표입니다. 개발자와 사이트 관리자에게 이는 '모든 것을 스크래핑한다'는 사고방식에서 벗어나 관리된 접근 방식을 채택해야 함을 의미합니다.
정당하고 가치 있는 AI 에이전트가 웹사이트의 특정 부분에 여전히 접근할 수 있도록 하려면, 소유자는 특정 권한을 구현해야 합니다. 이를 통해 기업은 OpenAI, Anthropic 또는 Google 기반의 AI 에이전트 중 어떤 것이 자신의 콘텐츠를 읽을 수 있는지, 그리고 어떤 조건 하에 허용할지를 선별할 수 있습니다. 더 넓은 AI 생태계 측면에서 보면, 이는 에이전트 개발자들이 자신을 식별하고 웹 서버에 정당성을 증명할 수 있는 더욱 정교한 방식이 필요함을 시사합니다.
이것이 AI 생태계에 중요한 이유
이번 변화는 콘텐츠 제작자와 AI 기업 모두에게 중요한 변곡점이 됩니다. 발행인에게는 콘텐츠가 결국 원작자와 경쟁하게 될 모델을 학습시키는 데 사용되는 '데이터 스크래핑 피로감(data scraping fatigue)'에 대응할 수 있는 절실한 방어 기제를 제공합니다. 통제권을 되찾음으로써 발행인은 지적 재산을 보호하고, AI 접근에 대한 새로운 수익화 모델을 탐색할 수도 있습니다.
에이전트 워크플로우를 구축하는 AI 개발자와 창업자들에게 이번 변화는 새로운 복잡성을 가져옵니다. 에이전트는 더 이상 모든 공개 HTML에 접근할 수 있다는 가정에 의존할 수 없습니다. AI 에이전트의 미래 경쟁력을 확보하려면, 권한 계층을 탐색하고 Cloudflare와 같은 주요 인프라 제공업체가 설정한 새로운 프로토콜을 준수하는 '컴플라이언스 인식(compliance-aware)' 능력을 갖추어야 합니다.
핵심 요약
- 기본 차단: 9월 15일부터 Cloudflare는 명시적인 권한이 부여되지 않는 한 보호된 사이트에서 AI 에이전트 크롤러를 자동으로 차단합니다.
- 발행인을 위한 통제권: 이번 조치는 권한을 웹사이트 소유자에게 다시 부여하여, 어떤 특정 AI 엔티티가 실시간 데이터를 수집할 수 있는지 결정할 수 있게 합니다.
- 에이전트를 위한 새로운 표준: AI 개발자는 웹 권한을 더 존중하도록 에이전트를 적응시켜야 하며, 구조화된 허가 기반의 크롤링 모델로 나아가야 합니다.
