Saya membina sebuah laman web yang ingin dipetik oleh pembantu AI dan, daripada sekadar meneka, saya melaksanakan tiga isyarat yang disyorkan secara meluas: entri robots.txt yang membenarkan crawler gaya GPT masuk, fail llms.txt yang menyenaraikan setiap halaman, dan skema JSON-LD yang menerangkan kandungan. Selepas menguji setiap satu, saya mendapati hanya satu yang boleh gagal tanpa amaran, manakala yang lain tidak berfungsi seperti yang didakwa oleh kebanyakan orang.

Mengapa tiga isyarat ini penting

Webmaster telah diberitahu bahawa crawler yang memfokuskan kepada AI memerlukan kebenaran eksplisit, bahawa indeks teks biasa “llms.txt” membantu model bahasa besar (LLM) mencari petikan yang relevan, dan bahawa data berstruktur JSON-LD meningkatkan peluang untuk dipetik. Janjinya mudah: tambah fail-fail ini, dan laman web anda akan mula muncul dalam jawapan yang dijana oleh AI, seterusnya memacu trafik dan keterlihatan jenama.

1. Membenarkan crawler AI dalam robots.txt

Baris robots.txt yang menyebut GPTBot (atau mana-mana bot AI lain) hanyalah satu permintaan. Jika rangkaian penghantaran kandungan (CDN) atau tembok api menyekat bot tersebut, permintaan itu tidak akan sampai ke laman web, dan crawler tidak dapat membaca fail tersebut sama sekali. Satu-satunya cara yang boleh dipercayai untuk mengetahui sama ada bot boleh mengakses anda adalah dengan menyemak kod status HTTP bagi setiap bot utama. Respons 403 (forbidden) atau 503 (service unavailable) bermakna segala infrastruktur lain tidak lagi relevan—tiada bot, tiada pengindeksan, tiada petikan.

2. Fail llms.txt

Fail llms.txt hanyalah senarai URL dalam format markdown, yang bertujuan untuk memberikan LLM peta laman web yang bersih supaya mereka tidak perlu membuat kesimpulan navigasi daripada HTML sahaja. Secara praktikalnya, dokumentasi Google menyatakan bahawa ia mengabaikan fail tersebut, dan tiada enjin carian utama yang berjanji untuk menggunakannya bagi tujuan petikan. Menyimpannya hampir tidak memerlukan kos, dan ia boleh berguna untuk ejen AI tersuai, tetapi ia tidak seharusnya diiklankan sebagai jalan pintas untuk mendapatkan lebih banyak petikan AI.

3. Skema JSON-LD

JSON-LD menyematkan data berstruktur—nama pengarang, tarikh penerbitan, ID produk—secara terus dalam sesebuah halaman. Ramai pemasar menganggap bahawa penambahan skema akan membuatkan halaman mereka muncul lebih kerap dalam jawapan AI, tetapi satu kajian terhadap 1,885 halaman tidak menemui sebarang peningkatan ketara dalam petikan daripada penandaan skema semata-mata. Nilai sebenar JSON-LD terletak pada resolusi entiti: ia memberitahu mesin bahawa “Jane Doe” pada satu halaman adalah “Jane Doe” yang sama pada halaman lain, sekali gus mengelakkan kekeliruan antara orang atau produk yang mempunyai nama yang serupa.

Kekangan sebenar: pengindeksan

Ketiga-tiga isyarat ini hanyalah infrastruktur asas; ia hanya berfungsi jika halaman tersebut diindeks terlebih dahulu. Halaman yang tidak pernah muncul dalam indeks tidak boleh diambil, tidak kira berapa banyak kebenaran crawler atau tag skema yang anda tambah. Penunjuk paling boleh dipercayai bagi kesihatan pengindeksan ialah laporan liputan dalam Google Search Console (atau alat yang setara untuk enjin lain). Jika sesuatu halaman muncul sebagai “tidak diindeks,” anda perlu membetulkannya sebelum bimbang tentang sebarang isyarat khusus AI.

Senarai semak praktikal

  1. Sahkan akses crawler – Uji respons HTTP untuk GPTBot, ClaudeBot, atau mana-mana crawler AI lain yang anda pentingkan. Langkah ini boleh gagal tanpa amaran; sekatan tidak akan menghasilkan amaran dalam analitik anda.
  2. Sahkan liputan indeks – Gunakan Search Console untuk melihat halaman mana yang diindeks, yang dikecualikan, dan mengapa. Selesaikan sebarang “ralat crawl” atau arahan “noindex” terlebih dahulu.
  3. Tambah infrastruktur asas – Sebaik sahaja akses dan pengindeksan sudah kukuh, masukkan llms.txt dan JSON-LD. Anggap ia sebagai pembantu penyelenggaraan rendah dan bukannya jaminan petikan.

Sudut pandangan berbeza

Sesetengah vendor masih memasarkan penjana llms.txt dan plugin skema sebagai pemacu SEO untuk AI. Data yang saya kumpulkan, ditambah dengan pendirian rasmi daripada enjin carian utama, menunjukkan bahawa dakwaan tersebut adalah berlebihan. Alatan tersebut tidak berbahaya, tetapi ia tidak sepatutnya menjadi teras kepada strategi petikan AI.

Apa yang perlu diperhatikan seterusnya

Pantau log crawler, perhatikan amaran Search Console, dan uji JSON-LD anda secara berkala dengan alatan pengesahan untuk memastikan aliran data yang lancar.

Kesimpulan: Jika anda mahu laman web anda dipetik oleh AI, berhenti menganggap llms.txt dan skema sebagai tiket ajaib. Pastikan bot benar-benar boleh mencapai anda dan halaman anda diindeks; hanya selepas itu fail tambahan tersebut akan memainkan peranan sokongan yang sederhana.

Sumber: hantaran asal di dev.to