J'ai créé un site web qui souhaite être cité par les assistants IA et, au lieu de deviner, j'ai mis en pratique trois signaux largement recommandés : une entrée dans robots.txt qui laisse entrer les crawlers de type GPT, un fichier llms.txt qui liste chaque page, et un schéma JSON-LD qui décrit le contenu. Après avoir testé chacun d'eux, j'ai découvert qu'un seul peut échouer sans avertissement, et que les autres ne font pas ce que la plupart des gens prétendent.

Pourquoi ces trois signaux sont importants

On a dit aux webmasters que les crawlers axés sur l'IA ont besoin d'une permission explicite, qu'un index en texte brut « llms.txt » aide les grands modèles de langage (LLM) à localiser des passages pertinents, et que les données structurées JSON-LD augmentent les chances d'être cité. La promesse est simple : ajoutez ces fichiers, et votre site commencera à apparaître dans les réponses générées par l'IA, générant ainsi du trafic et de la visibilité pour la marque.

1. Autoriser les crawlers d'IA dans robots.txt

La ligne robots.txt mentionnant GPTBot (ou tout autre bot d'IA) n'est qu'une requête. Si un réseau de diffusion de contenu (CDN) ou