GPTBot'u engellemek, sitenizi ChatGPT'nin cevap panelinden silmez. robots.txt dosyasına bota karşı bir kural ekleyen site sahipleri, kullanıcılar ChatGPT'ye konu hakkında soru sorduğunda makalelerinin hala bağlantılar ve özetlerle göründüğünü görünce şaşırdılar. Engelleme işe yaramıştı; sadece yanlış tarayıcıyı durdurmuştu.

Eğitim botları ve atıf botları

Yapay zeka sağlayıcıları iki farklı türde tarayıcı çalıştırır:

  • Eğitim botları (Training bots), halka açık sayfaları kazır, metni alır ve büyük dil modellerini ince ayar yapmak (fine-tune) için kullanır. Kaynağa asla bir bağlantı döndürmezler ve site için trafik oluşturmazlar.
  • Atıf botları (Citation bots), sorgu anında çalışır. Bir kullanıcı soru sorduğunda, bot web'de arama yapar, ilgili bir kesit çeker, kaynağın adını ve URL'sini ekler ve bunu sohbet penceresinde sunar. Bu etkileşimler gerçek ziyaretçiler getirebilir.

Eğitim botunu engellerseniz, model artık sayfalarınızdan öğrenemez. Atıf botunu engellerseniz, sayfa ChatGPT'nin canlı yanıtlarından kaybolur. Karışıklık, birçok sitenin "GPTBot"u, aynı ismin atıf iş akışında görünmediğini fark etmeden engellemesinden kaynaklanmaktadır.

Büyük oyuncular tarayıcılarını nasıl ayırıyor?

Sağlayıcı Eğitim botu adı Atıf botu adları
OpenAI GPTBot OAI-SearchBot, ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot, Claude-User
Google Google-Extended Googlebot
Perplexity — (her ikisi de atıf için kullanılır) PerplexityBot, Perplexity-User

İçeriğinizin gelecekteki model eğitimlerinin dışında kalmasını istiyorsanız, yalnızca "Eğitim botu adı" altındaki girişlerin reddedilmesi gerekir. ChatGPT'nin gerçek zamanlı yanıtlarında görünmek istiyorsanız, atıf botlarının izinli kalması gerekir.

robots.txt dosyasını doğru şekilde yapılandırmak

"GPTBot"u hedefleyen genel bir Disallow: / satırı eğitim tarayıcısını engeller ancak atıf botlarını olduğu gibi bırakır. Açık olmak gerekirse, atıf botlarına izin verirken her bir eğitim botunu reddeden kurallar ekleyin:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Allow citation bots
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

Sadece genel "*" karakterini engelleyen varsayılan bir robots.txt dosyasına güvenmeyin. Ayrım önemlidir çünkü genel bir engelleme hem eğitim hem de atıf botlarını dışarıda bırakarak yapay zeka destekli aramanın sağlayabileceği trafiği keser.

Cloudflare kullanıcıları: AI Crawl Control panelini kullanın

Alan adınız Cloudflare arkasındaysa, robots.txt dosyası içinde bir "Cloudflare yönetim işareti" (Cloudflare management marker) görebilirsiniz. Dosyayı manuel olarak düzenlemek, bir sonraki Cloudflare güncellemesinde değişikliklerin üzerine yazılmasına neden olabilir. Bunun yerine, Cloudflare AI Crawl Control arayüzüne gidin ve ilgili botlar için anahtarları açın/kapatın. Panel, arka planda doğru direktifleri yazar ve bunların kalıcı olmasını sağlar.

Nüanslar neden önemlidir?

  • Fikri mülkiyet koruması – Eğitim botlarını engellemek, metinlerinizin ücretsiz olarak toplanmasını ve gelecekteki modellere dahil edilmesini önler.
  • Yönlendirme trafiği – Atıf botlarına izin vermek, ChatGPT'de bir kesit gören kullanıcıların sitenize tıklayabilmesini sağlayarak gerçek ziyaretler oluşturur.
  • Marka görünürlüğü – Yapay zeka asistanları birçok kullanıcı için birincil bilgi kaynağı haline geldikçe, yapay zeka destekli aramalarda yer almak içeriğinizin keşfedilebilir kalmasını sağlar.

Karşı görüş

Bazı yayıncılar, metinlerinin atıf için bile olsa herhangi bir kullanımının daha geniş yapay zeka ekosistemine katkıda bulunduğunu ve atıf botlarını reddetmenin erişimlerine zarar verebileceğini savunuyor. Denge nettir: Ya modelin çalışmalarınızdan atıf yapmadan öğrenmesine izin verirsiniz ya da size alıntı yapmasına ve trafik çekmesine izin verirsiniz. Seçim, kelimelerinizin yeniden kullanımına ne kadar kontrol sahibi olmak istediğiniz ile anlık tıklamalara ne kadar değer verdiğiniz arasındaki dengeye bağlıdır.

Bundan sonra neyi takip etmeli?

Yapay zeka şirketleri, tarayıcılarını nasıl adlandıracakları ve yönlendirecekleri konusunda hala denemeler yapmaya devam ediyor. Geliştirici dokümantasyonlarındaki user-agent dizgilerindeki (user-agent strings) güncellemeleri takip edin. Yeni bir atıf botu farklı bir isimle ortaya çıkabilir ve daha önce engellenmiş bir eğitim botu yeniden adlandırılabilir. En güncel tarayıcı listesiyle uyumlu kalmak için robots.txt ve Cloudflare ayarlarınızı düzenli olarak denetleyin.

Özet: İçeriğinizin gelecekteki model eğitimlerinin dışında kalması için yalnızca eğitim botu user agent'larını engelleyin, ancak ChatGPT'nin kullanıcıları hala size yönlendirebilmesi için atıf botlarını etkin bırakın. İhtiyaç duyulduğunda Cloudflare'in AI Crawl Control özelliği aracılığıyla uygulanan doğru robots.txt kuralları, fikri mülkiyetinizi korurken yapay zeka destekli trafikten yararlanmanızı sağlar.