Cloudflare начнет блокировать поисковых роботов ИИ-агентов по умолчанию в этом сентябре
Эпоха неограниченного веб-скрейпинга с помощью искусственного интеллекта подходит к концу. Начиная с 15 сентября, Cloudflare внедрит масштабное изменение политики, которое будет блокировать поисковых роботов (crawlers) ИИ-агентов по умолчанию, открывая новую эру доступа к данным на основе разрешений.
Переход от пассивного скрейпинга к активному разрешению
На протяжении многих лет модели ИИ и автономные агенты функционировали путем обхода открытого веба, собирая данные для предоставления пользователям ответов в режиме реального времени. Однако недавнее заявление Cloudflare знаменует собой значительный поворот в том, как веб-инфраструктура обрабатывает этих «агентских» ботов. В отличие от традиционных поисковых роботов, которые индексируют страницы для последующего поиска, поисковые роботы ИИ-агентов извлекают контент в режиме реального времени для выполнения конкретных задач или ответов на сложные запросы от имени пользователя.
Начиная с 15 сентября, значительная часть веб-ресурсов, защищенных Cloudflare, будет автоматически ограничивать доступ этим агентам. Этот шаг призван дать владельцам веб-сайтов и издателям больше контроля над тем, как их проприетарные данные и творческий контент поглощаются большими языковыми моделями (LLM) и автономными агентами. Вместо принципа «все дозволено», веб-среда переходит к модели закрытых ворот, где боты должны явно запрашивать доступ.
Как разработчики и владельцы сайтов могут предоставить доступ
Несмотря на то, что настройки по умолчанию являются ограничительными, Cloudflare не стремится нарушить работу полезных инструментов ИИ. Напротив, цель состоит в том, чтобы установить структурированное «рукопожатие» между поисковым роботом и хостом. Для разработчиков и администраторов сайтов это означает отказ от менталитета «скрейпим всё подряд» в пользу управляемого подхода.
Чтобы гарантировать, что легитимные, высокоценные ИИ-агенты по-прежнему смогут получать доступ к определенным частям веб-сайта, владельцам потребуется внедрить специальные разрешения. Это позволит компаниям самостоятельно выбирать, какие ИИ-агенты — например, на базе OpenAI, Anthropic или Google — могут читать их контент, и, возможно, на каких условиях. Для более широкого ландшафта ИИ это потребует от разработчиков агентов более сложного способа самоидентификации и подтверждения своей легитимности перед веб-серверами.
Почему это важно для экосистемы ИИ
Это событие представляет собой критическую точку перелома как для создателей контента, так и для ИИ-компаний. Для издателей это обеспечивает столь необходимый механизм защиты от «усталости от скрейпинга данных», когда контент используется для обучения моделей, которые в конечном итоге могут конкурировать с первоначальными авторами. Возвращая контроль, издатели могут защитить свою интеллектуальную собственность и, возможно, изучить новые модели монетизации доступа для ИИ.
Для разработчиков ИИ и основателей компаний, создающих агентские рабочие процессы (agentic workflows), это изменение привносит новый уровень сложности. Агенты больше не могут полагаться на предположение, что весь публичный HTML-код доступен. Чтобы быть готовыми к будущему, ИИ-агенты должны стать «комплаенс-ориентированными» (compliance-aware), способными ориентироваться в уровнях разрешений и соблюдать новые протоколы, установленные крупными поставщиками инфраструктуры, такими как Cloudflare.
Основные выводы
- Блокировка по умолчанию: Начиная с 15 сентября, Cloudflare будет автоматически блокировать поисковых роботов ИИ-агентов на защищенных сайтах, если не предоставлено явное разрешение.
- Контроль для издателей: Этот шаг возвращает власть владельцам веб-сайтов, позволяя им решать, какие именно ИИ-сущности могут поглощать их данные в режиме реального времени.
- Новый стандарт для агентов: Разработчикам ИИ придется адаптировать своих агентов, чтобы они более уважительно относились к веб-разрешениям, переходя к структурированной модели сканирования на основе разрешений.
