Yapay zeka asistanları tarafından alıntılanmak isteyen bir web sitesi kurdum ve tahmin yürütmek yerine, yaygın olarak önerilen üç sinyali uygulamaya koydum: GPT tarzı tarayıcıların içeri girmesine izin veren bir robots.txt girişi, her sayfayı listeleyen bir llms.txt dosyası ve içeriği tanımlayan JSON-LD şeması. Her birini test ettikten sonra, yalnızca birinin uyarı vermeden başarısız olabileceğini, diğerlerinin ise çoğu insanın iddia ettiği şeyi yapmadığını gördüm.

Bu üç sinyal neden önemlidir

Web yöneticilerine; yapay zeka odaklı tarayıcıların açık izin gerektirdiği, düz metin bir "llms.txt" dizininin büyük dil modellerinin (LLM'ler) ilgili pasajları bulmasına yardımcı olduğu ve JSON-LD yapılandırılmış verilerinin alıntılanma olasılığını artırdığı söylendi. Vaat basittir: bu dosyaları ekleyin ve siteniz yapay zeka tarafından oluşturulan yanıtlarda görünmeye başlayarak trafik ve marka görünürlüğü sağlasın.

1. robots.txt ile yapay zeka tarayıcılarına izin vermek

GPTBot'tan (veya başka bir yapay zeka botundan) bahseden robots.txt satırı yalnızca bir taleptir. Eğer bir içerik dağıtım ağı (CDN) veya güvenlik duvarı botu engellerse, talep siteye asla ulaşmaz ve tarayıcı dosyayı hiçbir şekilde okuyamaz. Botun size erişip erişemeyeceğini bilmenin tek güvenilir yolu, her bir ana bot için HTTP durum kodunu kontrol etmektir. 403 (yasak) veya 503 (servis kullanılamıyor) yanıtı, geri kalan tüm altyapının anlamsız olduğu anlamına gelir; bot yoksa indeksleme de yok, alıntı da yok.

2. llms.txt dosyası

Bir llms.txt dosyası, LLM'lerin navigasyonu sadece HTML'den çıkarmak zorunda kalmamaları için onlara sitenin temiz bir haritasını sunmayı amaçlayan, sadece URL'lerden oluşan bir markdown listesidir. Uygulamada, Google'ın dokümantasyonu bu dosyayı görmezden geldiğini söylüyor ve hiçbir büyük arama motoru alıntı amacıyla bunu kullanacağına dair söz vermedi. Bunu bulundurmanın maliyeti neredeyse sıfırdır ve özel yapay zeka ajanları için kullanışlı olabilir, ancak daha fazla yapay zeka alıntısı için bir kestirme yol olarak pazarlanmamalıdır.

3. JSON-LD şeması

JSON-LD; yazar adları, yayın tarihleri, ürün kimlikleri gibi yapılandırılmış verileri doğrudan bir sayfaya gömer. Birçok pazarlamacı, şema eklemenin sayfalarının yapay zeka yanıtlarında daha sık görünmesini sağlayacağını varsayar, ancak 1.885 sayfalık bir çalışma, yalnızca şema işaretlemesinin alıntılarda ölçülebilir bir artış sağlamadığını bulmuştur. JSON-LD'nin gerçek değeri varlık çözümlemede (entity resolution) yatar: bir makineye, bir sayfadaki "Jane Doe" isminin başka bir sayfadaki aynı "Jane Doe" olduğunu söyler ve benzer isimli kişiler veya ürünler arasında karışıklığı önler.

Asıl darboğaz: indeksleme

Her üç sinyal de altyapı niteliğindedir; yalnızca sayfa en başta indekslenmişse işe yararlar. Bir sayfaya ne kadar çok tarayıcı izni veya şema etiketi eklerseniz ekleyin, bir indekste hiç görünmeyen bir sayfa geri getirilemez. İndeksleme sağlığının en güvenilir göstergesi, Google Search Console'daki (veya diğer arama motorları için eşdeğer araçtaki) kapsam raporudur. Eğer bir sayfa "indekslenmedi" olarak görünüyorsa, yapay zekaya özel sinyaller hakkında endişelenmeden önce bunu düzeltmeniz gerekir.

Pratik bir kontrol listesi

  1. Tarayıcı erişimini doğrulayın – GPTBot, ClaudeBot veya önem verdiğiniz diğer yapay zeka tarayıcıları için HTTP yanıtını test edin. Bu adım sessizce başarısız olabilir; bir engelleme analitiklerinizde bir uyarı oluşturmayacaktır.
  2. İndeks kapsamını onaylayın – Hangi sayfaların indekslendiğini, hangilerinin hariç tutulduğunu ve nedenini görmek için Search Console'u kullanın. Öncelikle tüm "tarama hatalarını" veya "noindex" direktiflerini çözün.
  3. Altyapıyı ekleyin – Erişim ve indeksleme sağlamlaştığında, llms.txt ve JSON-LD dosyalarını ekleyin. Bunları alıntı garantisi olarak değil, düşük bakım gerektiren yardımcılar olarak değerlendirin.

Karşı görüş

Bazı satıcılar hala llms.txt oluşturucuları ve şema eklentilerini yapay zeka için SEO güçlendiricileri olarak pazarlıyor. Topladığım veriler ve büyük arama motorlarının resmi duruşu, bu iddiaların abartılı olduğunu gösteriyor. Araçlar zararlı değil, ancak bir yapay zeka alıntı stratejisinin merkezinde yer almamalılar.

Bundan sonra neye dikkat edilmeli

Veri akışının devam etmesi için tarayıcı günlüklerini izleyin, Search Console uyarılarına göz kulak olun ve JSON-LD'nizi periyodik olarak doğrulama araçlarıyla test edin.

Özet: Eğer sitenizin yapay zeka tarafından alıntılanmasını istiyorsanız, llms.txt ve şemayı sihirli biletler olarak görmeyi bırakın. Botların size gerçekten ulaşabildiğinden ve sayfalarınızın indekslendiğinden emin olun; ancak o zaman bu ek dosyalar mütevazı ve destekleyici rollerini yerine getirebilir.

Kaynak: dev.to üzerindeki orijinal yazı