Zbudowałem stronę internetową, która chce być cytowana przez asystentów AI i zamiast zgadywać, wdrożyłem trzy szeroko rekomendowane sygnały: wpis w robots.txt pozwalający na dostęp crawlerom typu GPT, plik llms.txt zawierający listę wszystkich stron oraz schemat JSON-LD opisujący treść. Po przetestowaniu każdego z nich odkryłem, że tylko jeden może zawieść bez ostrzeżenia, a pozostałe nie działają tak, jak twierdzą większość osób.

Dlaczego te trzy sygnały są ważne

Webmasterom mówi się, że crawlerzy skupieni na AI potrzebują wyraźnej zgody, że tekstowy indeks „llms.txt” pomaga dużym modelom językowym (LLM) w lokalizowaniu istotnych fragmentów, a dane strukturalne JSON-LD zwiększają szanse na bycie cytowanym. Obietnica jest prosta: dodaj te pliki, a Twoja strona zacznie pojawiać się w odpowiedziach generowanych przez AI, co zwiększy ruch i widoczność marki.

1. Zezwalanie crawlerom AI w robots.txt

Linia w robots.txt wspominająca o GPTBot (lub jakimkolwiek innym botcie AI) jest jedynie prośbą. Jeśli sieć dostarczania treści (CDN) lub firewall zablokuje bota, prośba nigdy nie dotrze do strony, a crawler nie będzie mógł w ogóle odczytać pliku. Jedynym niezawodnym sposobem na sprawdzenie, czy bot ma do Ciebie dostęp, jest weryfikacja kodu statusu HTTP dla każdego głównego bota. Odpowiedź 403 (forbidden) lub 503 (service unavailable) oznacza, że cała reszta infrastruktury nie ma znaczenia — brak bota to brak indeksowania i brak cytowań.

2. Plik llms.txt

Plik llms.txt to po prostu lista adresów URL w formacie Markdown, mająca na celu dostarczenie modelom LLM przejrzystej mapy witryny, aby nie musiały wywnioskować nawigacji wyłącznie z kodu HTML. W praktyce dokumentacja Google mówi, że ignoruje ona ten plik, a żadna główna wyszukiwarka nie zadeklarowała używania go do celów cytowania. Jego utrzymywanie prawie nic nie kosztuje i może być przydatne dla niestandardowych agentów AI, ale nie powinno być reklamowane jako skrót do większej liczby cytowań przez AI.

3. Schemat JSON-LD

JSON-LD osadza dane strukturalne — imiona autorów, daty publikacji, identyfikatory produktów — bezpośrednio na stronie. Wielu marketerów zakłada, że dodanie schematu sprawi, że ich strony będą częściej pojawiać się w odpowiedziach AI, ale badanie 1885 stron nie wykazało mierzalnego wzrostu liczby cytowań wynikającego z samego oznaczenia schematem. Prawdziwa wartość JSON-LD tkwi w rozstrzyganiu encji (entity resolution): informuje ona maszynę, że „Jane Doe” na jednej stronie to ta sama „Jane Doe” na innej, co zapobiega pomyłkom między osobami lub produktami o podobnych nazwach.

Prawdziwe wąskie gardło: indeksowanie

Wszystkie trzy sygnały to jedynie podstawowa infrastruktura; działają one tylko wtedy, gdy strona jest w pierwszej kolejności zaindeksowana. Strony, która nigdy nie pojawi się w indeksie, nie można pobrać, niezależnie od tego, ile zezwoleń dla crawlerów czy tagów schematu dodasz. Najbardziej niezawodnym wskaźnikiem stanu indeksowania jest raport dotyczący pokrycia w Google Search Console (lub odpowiednim narzędziu dla innych wyszukiwarek). Jeśli strona pojawia się jako „niezindeksowana”, musisz to naprawić, zanim zaczniesz martwić się o jakiekolwiek sygnały specyficzne dla AI.

Praktyczna lista kontrolna

  1. Zweryfikuj dostęp crawlerów – Przetestuj odpowiedź HTTP dla GPTBot, ClaudeBot lub dowolnego innego istotnego dla Ciebie crawlera AI. Ten krok może zawieść po cichu; blokada nie wygeneruje ostrzeżenia w Twoich narzędziach analitycznych.
  2. Potwierdź pokrycie indeksu – Użyj Search Console, aby sprawdzić, które strony są zaindeksowane, które zostały wykluczone i dlaczego. Najpierw rozwiąż wszelkie „błędy indeksowania” lub dyrektywy „noindex”.
  3. Dodaj infrastrukturę – Gdy dostęp i indeksowanie będą stabilne, dodaj llms.txt i JSON-LD. Traktuj je jako pomocników wymagających niskiego nakładu pracy, a nie jako gwarancję cytowań.

Kontrargument

Niektórzy dostawcy wciąż promują generatory llms.txt i wtyczki schematów jako narzędzia wspomagające SEO pod kątem AI. Dane, które zebrałem, wraz z oficjalnym stanowiskiem głównych wyszukiwarek, sugerują, że te twierdzenia są przesadzone. Narzędzia te nie są szkodliwe, ale nie powinny stanowić centrum strategii pozyskiwania cytowań przez AI.

Na co zwrócić uwagę w następnej kolejności

Monitoruj logi crawlerów, zwracaj uwagę na alerty w Search Console i okresowo testuj swój JSON-LD za pomocą narzędzi walidacyjnych, aby zapewnić ciągłość przepływu danych.

Wniosek: Jeśli chcesz, aby Twoja strona była cytowana przez AI, przestań traktować llms.txt i schematy jak magiczne bilety. Upewnij się, że boty mogą faktycznie do Ciebie dotrzeć i że Twoje strony są zaindeksowane; dopiero wtedy dodat