Memblokir GPTBot tidak menghapus situs Anda dari panel jawaban ChatGPT. Pemilik situs yang menambahkan aturan robots.txt terhadap bot tersebut terkejut saat melihat artikel mereka masih muncul dengan tautan dan cuplikan ketika pengguna bertanya kepada ChatGPT tentang topik tersebut. Pemblokiran tersebut berhasil – hanya saja ia menghentikan crawler yang salah.

Bot pelatihan vs. bot sitasi

Penyedia AI menjalankan dua jenis crawler yang berbeda:

  • Bot pelatihan (Training bots) mengambil (scrape) halaman yang tersedia secara publik, menyerap teksnya, dan menggunakannya untuk melakukan fine-tuning pada model bahasa besar. Mereka tidak pernah mengembalikan tautan ke sumbernya, dan tidak menghasilkan lalu lintas (traffic) bagi situs tersebut.
  • Bot sitasi (Citation bots) beroperasi pada saat kueri. Ketika pengguna mengajukan pertanyaan, bot akan mencari di web, mengambil cuplikan yang relevan, menambahkan nama dan URL sumber, lalu menyajikannya di jendela obrolan. Klik dari bot ini dapat mendatangkan pengunjung nyata.

Jika Anda memblokir bot pelatihan, model tidak lagi dapat belajar dari halaman Anda. Jika Anda memblokir bot sitasi, halaman tersebut akan hilang dari jawaban langsung ChatGPT. Kebingungan muncul karena banyak situs memblokir “GPTBot” tanpa menyadari bahwa nama yang sama tidak muncul dalam alur kerja sitasi.

Bagaimana pemain besar membagi crawler mereka

Penyedia Nama bot pelatihan Nama bot sitasi
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (keduanya digunakan untuk sitasi) PerplexityBot, Perplexity-User

Hanya entri di bawah “Nama bot pelatihan” yang perlu ditolak jika Anda ingin menjaga konten Anda agar tidak masuk ke dalam pelatihan model di masa mendatang. Bot sitasi harus tetap diizinkan jika Anda ingin muncul dalam jawaban real-time ChatGPT.

Mengonfigurasi robots.txt dengan cara yang benar

Baris Disallow: / generik yang menargetkan “GPTBot” akan memblokir crawler pelatihan tetapi membiarkan bot sitasi tidak tersentuh. Agar lebih eksplisit, tambahkan aturan yang menolak setiap bot pelatihan sambil tetap mengizinkan bot sitasi:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

Jangan mengandalkan robots.txt default yang hanya memblokir "*" secara generik. Perbedaan ini penting karena pemblokiran menyeluruh akan menghentikan bot pelatihan sekaligus bot sitasi, sehingga memutus lalu lintas yang dapat diberikan oleh pencarian berbasis AI.

Pengguna Cloudflare: gunakan panel AI Crawl Control

Jika domain Anda berada di balik Cloudflare, Anda mungkin melihat “penanda manajemen Cloudflare” di dalam file robots.txt. Mengedit file secara manual dapat menyebabkan perubahan tersebut tertimpa pada pembaruan Cloudflare berikutnya. Sebaliknya, navigasikan ke antarmuka Cloudflare AI Crawl Control dan aktifkan/nonaktifkan sakelar untuk bot yang relevan. Panel tersebut akan menulis direktif yang benar di balik layar dan menjaganya agar tetap persisten.

Mengapa nuansa ini penting

  • Perlindungan hak kekayaan intelektual – Memblokir bot pelatihan mencegah tulisan Anda dipanen secara gratis dan dimasukkan ke dalam model di masa mendatang.
  • Lalu lintas rujukan (Referral traffic) – Mengizinkan bot sitasi berarti pengguna yang melihat cuplikan di ChatGPT dapat mengeklik dan menuju ke situs Anda, sehingga menghasilkan kunjungan nyata.
  • Visibilitas merek – Kehadiran dalam pencarian yang diperkuat AI menjaga konten Anda tetap dapat ditemukan seiring asisten AI menjadi sumber informasi utama bagi banyak pengguna.

Argumen tandingan

Beberapa penerbit berpendapat bahwa penggunaan teks mereka, bahkan untuk sitasi, berkontribusi pada ekosistem AI yang lebih luas dan bahwa menolak bot sitasi dapat merugikan jangkauan mereka. Pertukarannya jelas: Anda membiarkan model belajar dari karya Anda tanpa kredit, atau Anda membiarkannya mengutip Anda dan mendatangkan lalu lintas. Pilihannya tergantung pada bagaimana Anda menilai klik instan dibandingkan dengan kontrol jangka panjang atas bagaimana kata-kata Anda digunakan kembali.

Apa yang perlu diperhatikan selanjutnya

Perusahaan AI masih terus melakukan iterasi pada cara mereka menamai dan mengarahkan crawler mereka. Pantau terus pembaruan pada string user-agent di dokumentasi pengembang mereka. Bot sitasi baru bisa muncul dengan nama yang berbeda, dan bot pelatihan yang sebelumnya diblokir mungkin akan berganti nama. Lakukan audit secara berkala pada robots.txt dan pengaturan Cloudflare Anda agar tetap selaras dengan daftar crawler terbaru.

Kesimpulan: Blokir hanya user agent bot pelatihan untuk menjaga konten Anda agar tidak masuk ke dalam pelatihan model di masa mendatang, tetapi biarkan bot sitasi tetap aktif agar ChatGPT tetap dapat mengarahkan pengguna kembali ke Anda. Aturan robots.txt yang tepat, yang diterapkan melalui Cloudflare AI Crawl Control jika diperlukan, memungkinkan Anda melindungi kekayaan intelektual sambil tetap memanen lalu lintas berbasis AI.