In diesem Artikel 5
Kurze Antwort
KI-Anbieter setzen verschiedene Crawler für verschiedene Zwecke ein. Manche speisen die Suche (damit deine Website in ChatGPT, Perplexity oder Claude erscheinen und zitiert werden kann), andere sammeln Inhalte, um Modelle zu trainieren, und wieder andere werden aktiv, wenn ein Nutzer eine bestimmte Seite öffnen lässt. Du kannst das Training blockieren und die Suche erlauben oder umgekehrt. Nicht hilfreich ist es, mit einer Pauschalregel „alles, was nach KI klingt“ auszusperren und sich danach zu wundern, warum man nicht auftaucht.
Die Crawler, laut ihrer eigenen Dokumentation
| Anbieter | Suche (erlauben, wenn du erscheinen willst) | Training (eine eigene Entscheidung) | Auf Anfrage eines Nutzers |
|---|---|---|---|
| OpenAI (ChatGPT) | OAI-SearchBot | GPTBot | ChatGPT-User; laut OpenAI gelten die Regeln der robots.txt hier womöglich nicht, weil er auf Anfrage eines Nutzers handelt |
| Anthropic (Claude) | Claude-SearchBot | ClaudeBot | Claude-User |
| Perplexity | PerplexityBot; laut Dokumentation wird er nicht zum Training von Modellen genutzt | (nicht als solcher dokumentiert) | Perplexity-User; laut Dokumentation ignoriert er die robots.txt in der Regel |
| Google (Übersicht mit KI, KI-Modus, Gemini) | Googlebot, derselbe wie für die Suche | Google-Extended steuert die Nutzung für das Training von Gemini und für Grounding und hat keinen Einfluss auf die Aufnahme in die Google-Suche | |
| Microsoft (Copilot) | Bingbot |
Namen ändern sich, und die Anbieter passen ihre Richtlinien an; die Quellen am Ende sind die offiziellen Seiten zum Zeitpunkt des Schreibens.
So entscheidest du
Wenn du in der KI-Suche erscheinen willst: Erlaube OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot und Bingbot. Jede öffentliche Website kann in der ChatGPT-Suche erscheinen; blockierst du ihren Such-Crawler, deine nicht.
Wenn deine Inhalte keine Modelle trainieren sollen: Blockiere GPTBot, ClaudeBot und Google-Extended. Das ist eine legitime, eigenständige Entscheidung. Laut Googles Dokumentation hat das Blockieren von Google-Extended keinen Einfluss auf deine Präsenz in der Google-Suche.
Zu den Agenten „auf Anfrage eines Nutzers“: Sie werden aktiv, wenn eine Person die KI bittet, deine Seite zu öffnen. Mehrere Anbieter sagen, dass diese Anfragen die robots.txt womöglich nicht beachten. Musst du sie wirklich blockieren, tu es auf dem Server oder im CDN, im Wissen, dass du damit auch echte Menschen aussperrst, die dich lesen wollen.
Ein Beispiel für die robots.txt
Suche erlauben und Training blockieren:
- User-agent: GPTBot → Disallow: /
- User-agent: ClaudeBot → Disallow: /
- User-agent: Google-Extended → Disallow: /
- User-agent: OAI-SearchBot → Allow: /
- User-agent: Claude-SearchBot → Allow: /
- User-agent: PerplexityBot → Allow: /
Und natürlich: Sperr deine öffentlichen Seiten nicht für User-agent: * und versteck sie nicht hinter einem noindex, das der Crawler nicht lesen kann, weil die robots.txt ihn gar nicht erst hereinlässt.
Häufige Fehler
- Eine Regel „Disallow: /“ für alles, was „bot“ oder „GPT“ enthält, mit der die Suche gleich mit wegfällt.
- In der robots.txt blockieren und der Seite zusätzlich ein noindex geben: Der Crawler kann das noindex nicht lesen, wenn er nicht hineinkommt.
- Regeln im CDN oder in der Firewall, die KI-Crawlern einen 403 zurückgeben, ohne dass es jemand weiß. Prüf die Logs.
- Darauf vertrauen, dass eine Datei llms.txt all das ersetzt. Das tut sie nicht, und laut Google ist sie nicht nötig.
So prüfst du es
Öffne deinedomain.de/robots.txt und lies die Regeln. Prüf auf dem Server oder im CDN, welche Statuscodes die Anfragen dieser User-Agents bekommen. Danach miss: Taucht deine Website Wochen, nachdem du die Such-Crawler zugelassen hast, immer noch nicht auf, lag das Problem vermutlich nicht am Zugang.