Cloudflare заблокує краулерів ШІ-агентів за замовчуванням цього вересня

Епоха необмеженого веб-скрапінгу за допомогою штучного інтелекту добігає кінця. Починаючи з 15 вересня, Cloudflare впроваджуватиме суттєву зміну політики, яка за замовчуванням блокуватиме краулерів ШІ-агентів, що покладе початок новій ері доступу до даних на основі дозволів.

Перехід від пасивного скрапінгу до активного надання дозволів

Протягом багатьох років моделі ШІ та автономні агенти функціонували шляхом перегляду відкритого вебу, збираючи дані для надання користувачам відповідей у режимі реального часу. Однак нещодавнє оголошення Cloudflare знаменує собою значний поворот у тому, як веб-інфраструктура обробляє цих «агентних» ботів. На відміну від традиційних краулерів пошукових систем, які індексують сторінки для подальшого пошуку, краулери ШІ-агентів отримують контент у реальному часі для виконання конкретних завдань або надання відповідей на складні запити від імені користувача.

Починаючи з 15 вересня, значна частина вебу, захищена Cloudflare, автоматично обмежуватиме цих агентів. Цей крок покликаний надати власникам вебсайтів і видавцям більше контролю над тим, як їхні пропрієтарні дані та творчий контент поглинаються великими мовними моделями (LLM) та автономними агентами. Замість принципу «доступного для всіх», веб переходить до моделі з обмеженим доступом, де боти повинні явно запитувати дозвіл.

Як розробники та власники сайтів можуть надати доступ

Хоча налаштування за замовчуванням є обмежувальними, Cloudflare не має на меті порушити функціональність корисних інструментів ШІ. Натомість мета полягає в тому, щоб встановити структурований процес «рукостискання» між краулером і хостом. Для розробників і адміністраторів сайтів це означає відхід від менталітету «скрапити все підряд» до керованого підходу.

Щоб гарантувати, що легітимні, високоефективні ШІ-агенти все ще зможуть отримувати доступ до певних частин вебсайту, власникам потрібно буде впровадити спеціальні дозволи. Це дозволить бізнесу визначати, які саме ШІ-агенти — наприклад, на базі OpenAI, Anthropic або Google — можуть читати їхній контент, і, можливо, на певних умовах. Для всього ландшафту ШІ це створює потребу в більш складних способах ідентифікації розробниками агентів та підтвердження їхньої легітимності перед вебсерверами.

Чому це важливо для екосистеми ШІ

Ця подія є критичною точкою перегину як для творців контенту, так і для ШІ-компаній. Для видавців це забезпечує вкрай необхідний механізм захисту від «втоми від скрапінгу даних», коли контент використовується для навчання моделей, які згодом можуть конкурувати з оригінальними авторами. Повертаючи контроль, видавці можуть захистити свою інтелектуальну власність і потенційно дослідити нові моделі монетизації доступу для ШІ.

Для розробників ШІ та засновників, які створюють агентні робочі процеси (agentic workflows), ця зміна вносить новий рівень складності. Агенти більше не можуть покладатися на припущення, що весь публічний HTML-код є доступним. Щоб бути готовими до майбутнього, ШІ-агенти повинні стати «свідомими щодо відповідності стандартам» (compliance-aware), здатними орієнтуватися в рівнях дозволів і дотримуватися нових протоколів, встановлених великими постачальниками інфраструктури, такими як Cloudflare.

Основні висновки

  • Блокування за замовчуванням: Починаючи з 15 вересня, Cloudflare автоматично блокуватиме краулери ШІ-агентів на захищених сайтах, якщо не надано явного дозволу.
  • Контроль для видавців: Цей крок повертає владу власникам вебсайтів, дозволяючи їм вирішувати, які саме ШІ-сутності можуть поглинати їхні дані в режимі реального часу.
  • Новий стандарт для агентів: Розробники ШІ повинні адаптувати своїх агентів, щоб вони більше поважали веб-дозволи, переходячи до структурованої моделі краулінгу на основі дозволів.