Menyekat GPTBot tidak memadamkan laman web anda daripada panel jawapan ChatGPT. Pemilik laman web yang menambah peraturan robots.txt terhadap bot tersebut terkejut apabila melihat artikel mereka masih muncul dengan pautan dan petikan apabila pengguna bertanya kepada ChatGPT tentang topik tersebut. Sekatan itu berjaya – ia cuma menghentikan pengikis yang salah.
Bot latihan vs. bot petikan
Penyedia AI menjalankan dua jenis pengikis yang berbeza:
- Bot latihan mengikis halaman yang tersedia secara awam, menyerap teks, dan menggunakannya untuk memperhalusi model bahasa besar. Mereka tidak pernah mengembalikan pautan ke sumber, dan tidak menjana trafik untuk laman web tersebut.
- Bot petikan beroperasi semasa waktu pertanyaan. Apabila pengguna bertanya soalan, bot tersebut mencari di web, mengambil petikan yang relevan, menambah nama dan URL sumber, dan memaparkannya dalam tetingkap sembang. Klik tersebut boleh membawa pelawat sebenar.
Jika anda menyekat bot latihan, model tersebut tidak lagi dapat belajar daripada halaman anda. Jika anda menyekat bot petikan, halaman tersebut akan hilang daripada jawapan langsung ChatGPT. Kekeliruan timbul kerana banyak laman web menyekat “GPTBot” tanpa menyedari bahawa nama yang sama tidak muncul dalam aliran kerja petikan.
Bagaimana pemain besar membahagikan pengikis mereka
| Penyedia | Nama bot latihan | Nama-nama bot petikan |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (kedua-duanya digunakan untuk petikan) | PerplexityBot, Perplexity-User |
Hanya entri di bawah “Nama bot latihan” perlu disekat jika anda ingin menghalang kandungan anda daripada latihan model pada masa hadapan. Bot petikan harus dibenarkan jika anda ingin muncul dalam jawapan masa nyata ChatGPT.
Mengkonfigurasi robots.txt dengan cara yang betul
Baris Disallow: / generik yang menyasarkan “GPTBot” menyekat pengikis latihan tetapi membiarkan bot petikan tidak terusik. Untuk lebih jelas, tambahkan peraturan yang menyekat setiap bot latihan sambil membenarkan bot petikan:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
Jangan bergantung pada robots.txt lalai yang hanya menyekat “*” generik. Perbezaan ini penting kerana sekatan menyeluruh akan menyekat kedua-dua bot latihan dan petikan, sekali gus memutuskan trafik yang boleh disediakan oleh carian dipacu AI.
Pengguna Cloudflare: gunakan panel AI Crawl Control
Jika domain anda berada di belakang Cloudflare, anda mungkin melihat “penanda pengurusan Cloudflare” di dalam fail robots.txt. Mengedit fail secara manual boleh menyebabkan perubahan tersebut ditulis semula semasa kemas kini Cloudflare seterusnya. Sebaliknya, navigasi ke antara muka AI Crawl Control Cloudflare dan tukar suis untuk bot yang berkaitan. Panel tersebut menulis arahan yang betul di sebalik tabir dan mengekalkannya secara kekal.
Mengapa perbezaan halus ini penting
- Perlindungan harta intelek – Menyekat bot latihan menghalang penulisan anda daripada dituai secara percuma dan digabungkan ke dalam model masa hadapan.
- Trafik rujukan – Membenarkan bot petikan bermakna pengguna yang melihat petikan dalam ChatGPT boleh klik ke laman web anda, menjana lawatan sebenar.
- Kebolehlihatan jenama – Kehadiran dalam carian yang dipertingkatkan AI memastikan kandungan anda mudah ditemui apabila pembantu AI menjadi sumber maklumat utama bagi ramai pengguna.
Hujah balas
Sesetengah penerbit berhujah bahawa sebarang penggunaan teks mereka, walaupun untuk petikan, menyumbang kepada ekosistem AI yang lebih luas dan bahawa menolak bot petikan boleh menjejaskan capaian mereka. Pertukaran (trade-off) ini jelas: anda sama ada membiarkan model belajar daripada kerja anda tanpa kredit, atau anda membiarkannya memetik anda dan membawa trafik. Pilihan bergantung pada bagaimana anda menilai klik segera berbanding kawalan jangka panjang terhadap cara kata-kata anda digunakan semula.
Apa yang perlu diperhatikan seterusnya
Syarikat AI masih melakukan iterasi tentang cara mereka menamakan dan mengarahkan pengikis mereka. Perhatikan kemas kini pada rentetan user-agent dalam dokumentasi pembangun mereka. Bot petikan baharu mungkin muncul di bawah nama yang berbeza, dan bot latihan yang sebelum ini disekat mungkin dinamakan semula. Audit robots.txt dan tetapan Cloudflare anda secara berkala untuk kekal selaras dengan senarai pengikis terkini.
Rumusan: Sekat hanya ejen pengguna bot latihan untuk menghalang kandungan anda daripada latihan model pada masa hadapan, tetapi biarkan bot petikan diaktifkan supaya ChatGPT masih boleh merujuk pengguna kembali kepada anda. Peraturan robots.txt yang betul, yang digunakan melalui AI Crawl Control Cloudflare apabila perlu, membolehkan anda melindungi harta intelek anda sambil menuai trafik dipacu AI.
