Блокування GPTBot не видаляє ваш сайт із вікна відповідей ChatGPT. Власники сайтів, які додали правило в robots.txt проти цього бота, були здивовані, побачивши, що їхні статті все одно з'являються з посиланнями та уривками, коли користувачі запитують ChatGPT про цю тему. Блокування спрацювало — воно просто зупинило не того краулера.

Боти для навчання проти ботів для цитування

Постачальники ШІ використовують два різні типи краулерів:

  • Боти для навчання збирають (scrape) публічно доступні сторінки, поглинають текст і використовують його для донавчання (fine-tune) великих мовних моделей. Вони ніколи не повертають посилання на джерело і не генерують трафік для сайту.
  • Боти для цитування працюють під час запиту. Коли користувач ставить запитання, бот шукає в мережі, витягує релевантний фрагмент, додає назву та URL джерела і відображає це у вікні чату. Такі переходи можуть приносити реальних відвідувачів.

Якщо ви заблокуєте бота для навчання, модель більше не зможе вчитися на ваших сторінках. Якщо ви заблокуєте бота для цитування, сторінка зникне з відповідей ChatGPT у реальному часі. Плутанина виникає через те, що багато сайтів блокують «GPTBot», не усвідомлюючи, що ця сама назва не використовується у процесі цитування.

Як великі гравці розділяють своїх краулерів

Провайдер Назва бота для навчання Назви ботів для цитування
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (обидва використовуються для цитування) PerplexityBot, Perplexity-User

Тільки записи в колонці «Назва бота для навчання» потрібно заборонити, якщо ви хочете виключити свій контент із майбутнього навчання моделей. Боти для цитування мають залишатися дозволеними, якщо ви хочете з'являтися у відповідях ChatGPT у реальному часі.

Як правильно налаштувати robots.txt

Загальний рядок Disallow: /, спрямований на «GPTBot», блокує краулер для навчання, але не чіпає ботів для цитування. Щоб діяти чітко, додайте правила, які забороняють кожного бота для навчання, але дозволяють ботів для цитування:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

Не покладайтеся на стандартний robots.txt, який блокує лише загальний символ «*». Ця різниця є важливою, оскільки повне блокування виключить і ботів для навчання, і ботів для цитування, позбавивши вас трафіку, який може забезпечити пошук на основі ШІ.

Користувачам Cloudflare: використовуйте панель AI Crawl Control

Якщо ваш домен працює через Cloudflare, ви можете побачити «Cloudflare management marker» у файлі robots.txt. Ручне редагування файлу може призвести до того, що зміни будуть перезаписані під час наступного оновлення Cloudflare. Замість цього перейдіть до інтерфейсу Cloudflare AI Crawl Control і перемкніть тумблери для відповідних ботів. Панель автоматично записує правильні директиви та забезпечує їх збереження.

Чому цей нюанс має значення

  • Захист інтелектуальної власності — Блокування ботів для навчання запобігає безкоштовному збору ваших текстів та їхньому включенню в майбутні моделі.
  • Реферальний трафік — Дозвіл ботам для цитування означає, що користувачі, які бачать фрагмент у ChatGPT, можуть перейти на ваш сайт, що генерує реальні візити.
  • Видимість бренду — Присутність у пошуку з підтримкою ШІ допомагає вашому контенту залишатися доступним, оскільки ШІ-асистенти стають основним джерелом інформації для багатьох користувачів.

Контраргумент

Деякі видавці стверджують, що будь-яке використання їхнього тексту, навіть для цитування, робить внесок у ширшу екосистему ШІ, і що відмова від ботів для цитування може зменшити їхнє охоплення. Компроміс очевидний: ви або дозволяєте моделі вчитися на ваших роботах без зазначення авторства, або дозволяєте їй цитувати вас і приводити трафік. Вибір залежить від того, що ви цінуєте більше: миттєві кліки чи довгостроковий контроль над тим, як використовуються ваші слова.

На що звернути увагу далі

Компанії, що розробляють ШІ, все ще вдосконалюють способи іменування та маршрутизації своїх краулерів. Стежте за оновленнями рядків user-agent у їхній документації для розробників. Новий бот для цитування може з'явитися під іншою назвою, а раніше заблокований бот для навчання може бути перейменований. Регулярно перевіряйте свій robots.txt та налаштування Cloudflare, щоб залишатися в курсі останніх змін у списку краулерів.

Підсумок: Блокуйте лише user-агенти ботів для навчання, щоб виключити свій контент із майбутнього навчання моделей, але залиште ботів для цитування увімкненими, щоб ChatGPT міг направляти користувачів до вас. Правильні правила robots.txt, застосовані через Cloudflare AI Crawl Control (за потреби), дозволяють захистити вашу інтелектуальну власність, водночас отримуючи трафік від ШІ.