Das Blockieren von GPTBot löscht Ihre Website nicht aus dem Antwortfenster von ChatGPT. Website-Betreiber, die eine robots.txt-Regel gegen den Bot hinzugefügt haben, waren überrascht zu sehen, dass ihre Artikel immer noch mit Links und Auszügen angezeigt werden, wenn Nutzer ChatGPT nach dem Thema fragen. Die Blockierung hat funktioniert – sie hat nur den falschen Crawler gestoppt.
Trainings-Bots vs. Zitations-Bots
KI-Anbieter betreiben zwei verschiedene Arten von Crawlern:
- Trainings-Bots scrapen öffentlich verfügbare Seiten, nehmen den Text auf und nutzen ihn zum Fine-Tuning großer Sprachmodelle. Sie geben niemals einen Link zur Quelle an und generieren keinen Traffic für die Website.
- Zitations-Bots agieren zum Zeitpunkt der Suchanfrage. Wenn ein Nutzer eine Frage stellt, durchsucht der Bot das Web, zieht ein relevantes Snippet, fügt den Namen und die URL der Quelle hinzu und präsentiert dies im Chat-Fenster. Diese Klicks können echte Besucher anziehen.
Wenn Sie den Trainings-Bot blockieren, kann das Modell nicht mehr von Ihren Seiten lernen. Wenn Sie den Zitations-Bot blockieren, verschwindet die Seite aus den Live-Antworten von ChatGPT. Die Verwirrung entsteht, weil viele Websites „GPTBot“ blockieren, ohne zu merken, dass derselbe Name nicht im Zitations-Workflow erscheint.
Wie die großen Player ihre Crawler aufteilen
| Anbieter | Name des Trainings-Bots | Namen der Zitations-Bots |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (beide für Zitate genutzt) | PerplexityBot, Perplexity-User |
Nur die Einträge unter „Name des Trainings-Bots“ müssen verweigert werden, wenn Sie Ihren Inhalt vom zukünftigen Modelltraining fernhalten wollen. Die Zitations-Bots sollten erlaubt bleiben, wenn Sie in den Echtzeit-Antworten von ChatGPT erscheinen möchten.
Die richtige Konfiguration der robots.txt
Eine generische Disallow: /-Zeile, die auf „GPTBot“ abzielt, blockiert den Trainings-Crawler, lässt die Zitations-Bots jedoch unberührt. Um explizit zu sein, fügen Sie Regeln hinzu, die jeden Trainings-Bot ablehnen, während die Zitations-Bots erlaubt bleiben:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
Verlassen Sie sich nicht auf eine Standard-robots.txt, die nur das generische „*“ blockiert. Die Unterscheidung ist wichtig, da ein pauschales Blockieren sowohl Trainings- als auch Zitations-Bots ausschließen würde, was den Traffic unterbindet, den die KI-gestützte Suche liefern kann.
Cloudflare-Nutzer: Verwenden Sie das AI Crawl Control Panel
Wenn Ihre Domain hinter Cloudflare liegt, sehen Sie möglicherweise einen „Cloudflare-Management-Marker“ innerhalb der robots.txt-Datei. Das manuelle Bearbeiten der Datei kann dazu führen, dass Änderungen beim nächsten Cloudflare-Update überschrieben werden. Navigieren Sie stattdessen zur Cloudflare AI Crawl Control-Oberfläche und schalten Sie die Regler für die relevanten Bots um. Das Panel schreibt die korrekten Anweisungen im Hintergrund und sorgt dafür, dass sie dauerhaft gespeichert bleiben.
Warum diese Nuance wichtig ist
- Schutz des geistigen Eigentums – Das Blockieren von Trainings-Bots verhindert, dass Ihre Texte kostenlos geerntet und in zukünftige Modelle integriert werden.
- Verweisungs-Traffic – Das Zulassen von Zitations-Bots bedeutet, dass Nutzer, die ein Snippet in ChatGPT sehen, auf Ihre Website klicken können, was echte Besuche generiert.
- Markensichtbarkeit – Die Präsenz in der KI-gestützten Suche sorgt dafür, dass Ihre Inhalte auffindbar bleiben, während KI-Assistenten für viele Nutzer zu einer primären Informationsquelle werden.
Das Gegenargument
Einige Publisher argumentieren, dass jede Nutzung ihrer Texte, selbst zur Zitierung, zum breiteren KI-Ökosystem beiträgt und dass das Ablehnen von Zitations-Bots ihre Reichweite beeinträchtigen könnte. Der Kompromiss ist klar: Entweder lassen Sie das Modell ohne Nennung von Ihrer Arbeit lernen, oder Sie lassen es Sie zitieren und Traffic generieren. Die Entscheidung hängt davon ab, wie sehr Sie sofortige Klicks gegenüber der langfristigen Kontrolle darüber bewerten, wie Ihre Worte wiederverwendet werden.
Worauf Sie als Nächstes achten sollten
KI-Unternehmen arbeiten ständig daran, wie sie ihre Crawler benennen und steuern. Achten Sie auf Aktualisierungen der User-Agent-Strings in deren Entwicklerdokumentation. Ein neuer Zitations-Bot könnte unter einem anderen Namen erscheinen, und ein zuvor blockierter Trainings-Bot könnte umbenannt werden. Überprüfen Sie regelmäßig Ihre robots.txt- und Cloudflare-Einstellungen, um mit der neuesten Liste der Crawler Schritt zu halten.
Takeaway: Blockieren Sie nur die User-Agents der Trainings-Bots, um Ihren Inhalt vom zukünftigen Modelltraining fernzuhalten, aber lassen Sie die Zitations-Bots aktiviert, damit ChatGPT die Nutzer weiterhin auf Sie verweisen kann. Die richtigen robots.txt-Regeln, die bei Bedarf über Cloudflares AI Crawl Control angewendet werden, ermöglichen es Ihnen, Ihr geistiges Eigentum zu schützen und gleichzeitig den KI-gesteuerten Traffic zu nutzen.
