Ho costruito un sito web che desidera essere citato dagli assistenti AI e, invece di tirare a indovinare, ho messo in pratica tre segnali ampiamente raccomandati: una voce nel robots.txt che permette l'accesso ai crawler di tipo GPT, un file llms.txt che elenca ogni pagina e uno schema JSON-LD che descrive il contenuto. Dopo aver testato ciascuno di essi, ho scoperto che solo uno può fallire senza preavviso, mentre gli altri non fanno ciò che la maggior parte delle persone sostiene.

Perché i tre segnali sono importanti

Ai webmaster è stato detto che i crawler focalizzati sull'IA necessitano di un permesso esplicito, che un indice in testo semplice "llms.txt" aiuta i modelli linguistici di grandi dimensioni (LLM) a individuare passaggi rilevanti e che i dati strutturati JSON-LD aumentano le probabilità di essere citati. La promessa è semplice: aggiungi questi file e il tuo sito inizierà ad apparire nelle risposte generate dall'IA, guidando traffico e visibilità del brand.

1. Consentire l'accesso ai crawler AI in robots.txt

La riga nel robots.txt che menziona GPTBot (o qualsiasi altro bot IA) è solo una richiesta. Se una rete di distribuzione dei contenuti (CDN) o un firewall blocca il bot, la richiesta non raggiunge mai il sito e il crawler non può affatto leggere il file. L'unico modo affidabile per sapere se il bot può accederti è controllare il codice di stato HTTP per ogni bot principale. Una risposta 403 (proibito) o 503 (servizio non disponibile) significa che il resto dell'infrastruttura è irrilevante: niente bot, niente indicizzazione, niente citazione.

2. Il file llms.txt

Un file llms.txt è solo un elenco markdown di URL, pensato per fornire agli LLM una mappa pulita di un sito, in modo che non debbano inferire la navigazione solo dall'HTML. In pratica, la documentazione di Google afferma di ignorare il file e nessun grande motore di ricerca ha promesso di utilizzarlo per scopi di citazione. Tenerlo è quasi gratuito e può essere utile per agenti IA personalizzati, ma non dovrebbe essere pubblicizzato come una scorciatoia per ottenere più citazioni dall'IA.

3. Schema JSON-LD

JSON-LD incorpora dati strutturati — nomi degli autori, date di pubblicazione, ID prodotto — direttamente in una pagina. Molti marketer presumono che l'aggiunta di uno schema farà apparire le loro pagine più spesso nelle risposte dell'IA, ma uno studio su 1.885 pagine non ha riscontrato alcun incremento misurabile nelle citazioni derivanti solo dalla marcatura dello schema. Il vero valore di JSON-LD risiede nella risoluzione delle entità: comunica a una macchina che "Jane Doe" in una pagina è la stessa "Jane Doe" in un'altra, evitando confusione tra persone o prodotti con nomi simili.

Il vero collo di bottiglia: l'indicizzazione

Tutti e tre i segnali sono componenti di base; funzionano solo se la pagina è innanzitutto indicizzata. Una pagina che non appare mai in un indice non può essere recuperata, indipendentemente da quanti permessi per i crawler o tag di schema si aggiungano. L'indicatore più affidabile della salute dell'indicizzazione è il rapporto sulla copertura in Google Search Console (o lo strumento equivalente per altri motori). Se una pagina risulta "non indicizzata", è necessario risolvere il problema prima di preoccuparsi di qualsiasi segnale specifico per l'IA.

Una checklist pratica

  1. Verifica l'accesso dei crawler – Testa la risposta HTTP per GPTBot, ClaudeBot o qualsiasi altro crawler IA che ti interessi. Questo passaggio può fallire silenziosamente; un blocco non genererà un avviso nelle tue analisi.
  2. Conferma la copertura dell'indice – Usa Search Console per vedere quali pagine sono indicizzate, quali sono escluse e perché. Risolvi prima eventuali "errori di scansione" o direttive "noindex".
  3. Aggiungi l'infrastruttura – Una volta che l'accesso e l'indicizzazione sono solidi, inserisci llms.txt e JSON-LD. Trattali come assistenti a bassa manutenzione piuttosto che come garanzie di citazione.

Controargomentazione

Alcuni fornitori continuano a commercializzare generatori di llms.txt e plugin per schemi come booster SEO per l'IA. I dati che ho raccolto, insieme alla posizione ufficiale dei principali motori di ricerca, suggeriscono che tali affermazioni siano esagerate. Gli strumenti non sono dannosi, ma non dovrebbero essere il fulcro di una strategia di citazione tramite IA.

Cosa monitorare in seguito

Monitora i log dei crawler, tieni d'occhio gli avvisi di Search Console e testa periodicamente il tuo JSON-LD con strumenti di validazione per mantenere fluido il flusso di dati.

In sintesi: Se vuoi che il tuo sito venga citato dall'IA, smetti di trattare llms.txt e lo schema come biglietti magici. Assicurati che i bot possano effettivamente raggiungerti e che le tue pagine siano indicizzate; solo allora i file extra svolgeranno il loro modesto ruolo di supporto.

Fonte: il post originale su dev.to