Saya membangun sebuah situs web yang ingin dikutip oleh asisten AI dan, alih-alih menebak-nebak, saya menerapkan tiga sinyal yang banyak direkomendasikan: entri robots.txt yang mengizinkan crawler gaya GPT masuk, file llms.txt yang mencantumkan setiap halaman, dan skema JSON-LD yang mendeskripsikan konten. Setelah menguji masing-masing, saya menemukan bahwa hanya satu yang dapat gagal tanpa peringatan, dan yang lainnya tidak bekerja seperti yang diklaim kebanyakan orang.

Mengapa ketiga sinyal tersebut penting

Webmaster telah diberitahu bahwa crawler yang berfokus pada AI memerlukan izin eksplisit, bahwa indeks teks biasa "llms.txt" membantu model bahasa besar (LLM) menemukan bagian yang relevan, dan bahwa data terstruktur JSON-LD meningkatkan peluang untuk dikutip. Janjinya sederhana: tambahkan file-file ini, dan situs Anda akan mulai muncul dalam jawaban yang dihasilkan AI, mendorong trafik dan visibilitas merek.

1. Mengizinkan crawler AI di robots.txt

Baris robots.txt yang menyebutkan GPTBot (atau bot AI lainnya) hanyalah sebuah permintaan. Jika content delivery network (CDN) atau firewall memblokir bot tersebut, permintaan tidak akan pernah sampai ke situs, dan crawler tidak dapat membaca file tersebut sama sekali. Satu-satunya cara andal untuk mengetahui apakah bot dapat mengakses Anda adalah dengan memeriksa kode status HTTP untuk setiap bot utama. Respons 403 (forbidden) atau 503 (service unavailable) berarti seluruh infrastruktur teknis lainnya menjadi tidak berguna—tidak ada bot, tidak ada pengindeksan, tidak ada kutipan.

2. File llms.txt

File llms.txt hanyalah daftar URL dalam format markdown, yang dimaksudkan untuk memberi LLM peta situs yang bersih sehingga mereka tidak perlu menyimpulkan navigasi hanya dari HTML saja. Dalam praktiknya, dokumentasi Google menyatakan bahwa mereka mengabaikan file tersebut, dan tidak ada mesin pencari utama yang berjanji akan menggunakannya untuk tujuan kutipan. Menyimpannya hampir tidak memakan biaya, dan bisa berguna untuk agen AI khusus, tetapi tidak seharusnya diiklankan sebagai jalan pintas untuk mendapatkan lebih banyak kutipan AI.

3. Skema JSON-LD

JSON-LD menyematkan data terstruktur—nama penulis, tanggal publikasi, ID produk—langsung di dalam halaman. Banyak pemasar berasumsi bahwa menambahkan skema akan membuat halaman mereka lebih sering muncul dalam jawaban AI, tetapi sebuah studi terhadap 1.885 halaman tidak menemukan peningkatan kutipan yang terukur hanya dari penandaan skema saja. Nilai sebenarnya dari JSON-LD terletak pada resolusi entitas: ia memberi tahu mesin bahwa "Jane Doe" di satu halaman adalah "Jane Doe" yang sama di halaman lain, mencegah kebingungan antara orang atau produk dengan nama serupa.

Hambatan sebenarnya: pengindeksan

Ketiga sinyal tersebut hanyalah infrastruktur dasar; mereka hanya berfungsi jika halaman tersebut terindeks sejak awal. Halaman yang tidak pernah muncul dalam indeks tidak dapat diambil, tidak peduli berapa banyak izin crawler atau tag skema yang Anda tambahkan. Indikator kesehatan pengindeksan yang paling andal adalah laporan cakupan di Google Search Console (atau alat yang setara untuk mesin pencari lain). Jika sebuah halaman muncul sebagai "tidak diindeks", Anda perlu memperbaikinya sebelum mengkhawatirkan sinyal khusus AI apa pun.

Daftar periksa praktis

  1. Verifikasi akses crawler – Uji respons HTTP untuk GPTBot, ClaudeBot, atau crawler AI lainnya yang Anda pedulikan. Langkah ini dapat gagal secara diam-diam; pemblokiran tidak akan menghasilkan peringatan di analitik Anda.
  2. Konfirmasi cakupan indeks – Gunakan Search Console untuk melihat halaman mana yang diindeks, mana yang dikecualikan, dan mengapa. Selesaikan setiap "kesalahan perayapan" atau arahan "noindex" terlebih dahulu.
  3. Tambahkan infrastruktur dasar – Setelah akses dan pengindeksan sudah solid, masukkan llms.txt dan JSON-LD. Perlakukan mereka sebagai pembantu dengan pemeliharaan rendah, bukan sebagai jaminan kutipan.

Sisi lain

Beberapa vendor masih memasarkan generator llms.txt dan plugin skema sebagai pendorong SEO untuk AI. Data yang saya kumpulkan, ditambah dengan sikap resmi dari mesin pencari utama, menunjukkan bahwa klaim tersebut berlebihan. Alat-alat tersebut tidak berbahaya, tetapi tidak seharusnya menjadi pusat dari strategi kutipan AI.

Apa yang perlu diperhatikan selanjutnya

Pantau log crawler, perhatikan peringatan Search Console, dan secara berkala uji JSON-LD Anda dengan alat validasi untuk menjaga alur data tetap lancar.

Poin utama: Jika Anda ingin situs Anda dikutip oleh AI, berhentilah menganggap llms.txt dan skema sebagai tiket ajaib. Pastikan bot benar-benar dapat menjangkau Anda dan halaman Anda terindeks; hanya dengan begitu file tambahan tersebut dapat menjalankan peran pendukungnya yang sederhana.

Sumber: postingan asli di dev.to