Ich habe eine Website erstellt, die von KI-Assistenten zitiert werden soll. Anstatt zu raten, habe ich drei weit verbreitete Signale implementiert: einen robots.txt-Eintrag, der GPT-ähnlichen Crawlern den Zugang erlaubt, eine llms.txt-Datei, die jede Seite auflistet, und ein JSON-LD-Schema, das den Inhalt beschreibt. Nachdem ich jedes einzelne getestet habe, habe ich festgestellt, dass nur eines ohne Warnung fehlschlagen kann und die anderen nicht das tun, was die meisten behaupten.

Warum diese drei Signale wichtig sind

Webmastern wird oft gesagt, dass KI-fokussierte Crawler explizite Erlaubnis benötigen, dass ein reiner Text-Index „llms.txt“ Large Language Models (LLMs) hilft, relevante Passagen zu finden, und dass JSON-LD-Strukturdaten die Chancen auf eine Zitierung erhöhen. Das Versprechen ist simpel: Füge diese Dateien hinzu, und deine Website wird in KI-generierten Antworten auftauchen, was den Traffic und die Markenbekanntheit steigert.

1. KI-Crawler in der robots.txt zulassen

Die robots.txt-Zeile, die GPTBot (oder einen anderen KI-Bot) erwähnt, ist nur eine Anfrage. Wenn ein Content Delivery Network (CDN) oder eine Firewall den Bot blockiert, erreicht die Anfrage die Website nie, und der Crawler kann die Datei überhaupt nicht lesen. Der einzige zuverlässige Weg, um festzustellen, ob der Bot auf Sie zugreifen kann, ist die Überprüfung des HTTP-Statuscodes für jeden wichtigen Bot. Eine 403-Antwort (Forbidden) oder 503 (Service Unavailable) bedeutet, dass der Rest der Infrastruktur hinfällig ist – kein Bot, keine Indexierung, keine Zitierung.

2. Die llms.txt-Datei

Eine llms.txt-Datei ist lediglich eine Markdown-Liste von URLs, die darauf abzielt, LLMs eine saubere Karte der Website zu geben, damit sie die Navigation nicht allein aus dem HTML ableiten müssen. In der Praxis besagt die Dokumentation von Google, dass die Datei ignoriert wird, und keine große Suchmaschine hat zugesagt, sie für Zitierungszwecke zu nutzen. Sie bereitzustellen kostet fast nichts, und sie kann für benutzerdefinierte KI-Agenten nützlich sein, sollte aber nicht als Abkürzung zu mehr KI-Zitaten beworben werden.

3. JSON-LD-Schema

JSON-LD bettet strukturierte Daten – Autorennamen, Veröffentlichungsdaten, Produkt-IDs – direkt in eine Seite ein. Viele Marketer gehen davon aus, dass das Hinzufügen von Schema dazu führt, dass ihre Seiten häufiger in KI-Antworten erscheinen, aber eine Studie von 1.885 Seiten ergab keinen messbaren Anstieg der Zitierungen allein durch Schema-Markup. Der wahre Wert von JSON-LD liegt in der Entity Resolution: Es teilt einer Maschine mit, dass „Jane Doe“ auf einer Seite dieselbe „Jane Doe“ auf einer anderen ist, was Verwechslungen zwischen ähnlich benannten Personen oder Produkten verhindert.

Der wahre Flaschenhals: Indexierung

Alle drei Signale sind Infrastruktur; sie funktionieren nur, wenn die Seite überhaupt indexiert ist. Eine Seite, die nie in einem Index erscheint, kann nicht abgerufen werden, egal wie viele Crawler-Erlaubnisse oder Schema-Tags Sie hinzufügen. Der zuverlässigste Indikator für die Qualität der Indexierung ist der Abdeckungsbericht in der Google Search Console (oder das entsprechende Tool für andere Suchmaschinen). Wenn eine Seite als „nicht indexiert“ angezeigt wird, müssen Sie das beheben, bevor Sie sich um KI-spezifische Signale kümmern.

Eine praktische Checkliste

  1. Crawler-Zugriff überprüfen – Testen Sie die HTTP-Antwort für GPTBot, ClaudeBot oder jeden anderen KI-Crawler, der für Sie relevant ist. Dieser Schritt kann lautlos fehlschlagen; eine Blockierung erzeugt keine Warnung in Ihren Analysen.
  2. Indexabdeckung bestätigen – Nutzen Sie die Search Console, um zu sehen, welche Seiten indexiert sind, welche ausgeschlossen wurden und warum. Beheben Sie zuerst alle „Crawl-Fehler“ oder „noindex“-Anweisungen.
  3. Die Infrastruktur hinzufügen – Sobald der Zugriff und die Indexierung stabil sind, fügen Sie llms.txt und JSON-LD hinzu. Betrachten Sie diese eher als wartungsarme Helfer denn als Garanten für Zitierungen.

Gegenargument

Einige Anbieter vermarkten llms.txt-Generatoren und Schema-Plugins immer noch als SEO-Booster für KI. Die von mir gesammelten Daten sowie die offizielle Haltung der großen Suchmaschinen legen nahe, dass diese Behauptungen übertrieben sind. Die Tools sind nicht schädlich, sollten aber nicht das Herzstück einer Strategie für KI-Zitierungen sein.

Worauf man als Nächstes achten sollte

Überwachen Sie die Crawler-Logs, behalten Sie die Warnmeldungen der Search Console im Auge und testen Sie Ihr JSON-LD regelmäßig mit Validierungstools, um den Datenfluss aufrechtzuerhalten.

Fazit: Wenn Sie möchten, dass Ihre Website von KI zitiert wird, hören Sie auf, llms.txt und Schema wie Zaubertickets zu behandeln. Stellen Sie sicher, dass die Bots Sie tatsächlich erreichen können und dass Ihre Seiten indexiert sind; erst dann werden die zusätzlichen Dateien ihre bescheidene, unterstützende Rolle erfüllen.

Quelle: der ursprüngliche Post auf dev.to