Zum Inhalt springen
KI-Crawler-Check

Dürfen KI-Crawler auf deine Website?

Wir lesen deine robots.txt so, wie Crawler sie lesen, und sagen dir für jeden einzeln, ob er Zugriff hat. Dabei trennen wir die Crawler für die Suche von denen, die Daten fürs Training sammeln.

Wir rufen die öffentlichen Dateien deiner Website von unserem Server ab, so wie ein Crawler. Wir speichern weder die Domain noch das Ergebnis.

So funktioniert es

Was das Tool macht, Schritt für Schritt

  1. Schritt 1

    Wir rufen deine robots.txt ab

    Von unserem Server aus rufen wir https://deinefirma.de/robots.txt ab, folgen bis zu drei Weiterleitungen und lesen die Datei als Text.

  2. Schritt 2

    Wir wenden die Regeln des Standards an

    Jeder Crawler folgt der Gruppe mit seinem Namen oder, wenn es keine gibt, der Gruppe *. Die längste passende Regel gewinnt, bei Gleichstand Allow. Wir verstehen * und $.

  3. Schritt 3

    Du bekommst das Ergebnis und die Lösung

    Für jeden Crawler siehst du, ob er das Stammverzeichnis und deinen Pfad erreicht, welche Regel das entscheidet und, wenn du einen Such-Crawler blockierst, den Block, der ihn durchlässt.

Umfang

Was das Tool prüft und was es dir nicht sagt

Was es prüft

  • Fünfzehn Crawler und Agenten von OpenAI, Anthropic, Perplexity, Google, Microsoft, Apple, Common Crawl, Meta und ByteDance.
  • Das Stammverzeichnis deiner Website und den Pfad deiner Wahl, mit der Regel und der Zeile, die entscheiden.
  • Was passiert, wenn die Datei fehlt, der Server einen Fehler meldet oder mit einer HTML-Seite antwortet.
  • Angegebene Sitemaps und Zeilen, die Crawler nicht verstehen.

Was es dir nicht sagt

  • Ob eine Firewall oder dein CDN einen Crawler blockiert. robots.txt ist eine Bitte, keine Sperre; echte Sperren sitzen auf dem Server.
  • Ob Agenten, die auf Nutzeranfrage handeln, die Datei beachten. Manche Anbieter sagen, dass sie das nicht immer tun.
  • Ob eine KI dich zitiert. Dass ein Crawler Zugriff hat, ist notwendig, aber nicht ausreichend.
  • Noindex-Meta-Tags oder X-Robots-Tag-Header einzelner Seiten. Dafür prüft der Check für strukturierte Daten die Seite, die du angibst.
Referenz

Was jeder Crawler macht

Laut der Dokumentation des jeweiligen Anbieters. Namen und Richtlinien ändern sich: Die Quellen stehen am Ende.

KI-Suche

Lass sie zu, damit deine Website in Antworten erscheinen und zitiert werden kann.

  • OAI-SearchBot (OpenAI). ChatGPT-Suche. Wenn du ihn blockierst, erscheint deine Website dort nicht.
  • Claude-SearchBot (Anthropic). Claude-Suche.
  • PerplexityBot (Perplexity). Perplexity-Suche; laut Dokumentation wird er nicht zum Training von Modellen genutzt.

Suchmaschinen als Basis der KI

Googlebot speist AI Overviews und den AI Mode, Bingbot speist Copilot. Wenn du sie blockierst, verschwindest du auch aus der Suche.

  • Googlebot (Google). Der Crawler der Google Suche, auch für AI Overviews und den AI Mode.
  • Bingbot (Microsoft). Der Crawler von Bing, auf den Copilot zurückgreift.

Modelltraining

Sie sammeln Inhalte, die fürs Training genutzt werden können. Sie zu blockieren ist eine legitime Entscheidung, unabhängig davon, ob du erscheinst.

  • GPTBot (OpenAI). Sammelt Inhalte, die zum Training von Modellen genutzt werden können.
  • ClaudeBot (Anthropic). Modelltraining.
  • Google-Extended (Google). Crawlt nicht: ein Name, den Google liest, um über die Nutzung in Gemini und für Grounding zu entscheiden. Kein Einfluss auf die Google Suche.
  • Applebot-Extended (Apple). Crawlt nicht: Laut Apple legt er fest, ob das, was Applebot sammelt, zum Training der Apple-Modelle genutzt werden darf.
  • CCBot (Common Crawl). Offenes Archiv des Webs, mit dem schon viele Modelle trainiert wurden.
  • meta-externalagent (Meta). Laut Meta für Zwecke wie das Training von KI-Modellen oder die Verbesserung von Produkten.

Auf Nutzeranfrage

Sie öffnen eine Seite, wenn eine Person die KI darum bittet. Mehrere Anbieter geben an, dass sie robots.txt möglicherweise nicht beachten.

  • ChatGPT-User (OpenAI). Handelt auf Anfrage eines Nutzers; laut OpenAI gelten die Regeln der robots.txt dabei möglicherweise nicht.
  • Claude-User (Anthropic). Handelt, wenn ein Nutzer Claude bittet, eine Seite zu öffnen.
  • Perplexity-User (Perplexity). Auf Nutzeranfrage; laut Dokumentation ignoriert er robots.txt in der Regel.

Andere

Crawler, über die viele Websites bewusst entscheiden.

  • Bytespider (ByteDance). Der Crawler von ByteDance. Eine offizielle Dokumentation dazu verlinken wir nicht.

Quellen: OpenAI, Crawler von OpenAI; Anthropic, Crawler von Anthropic; Perplexity, Crawler von Perplexity; Google Search Central, gängige Crawler von Google; Apple, über Applebot; Common Crawl, CCBot; Meta, Web-Crawler von Meta; RFC 9309, Robots Exclusion Protocol.

Fragen

Häufige Fragen

Was vor und nach der Nutzung des Tools oft gefragt wird.

Deine Frage ist nicht dabei? Schreib uns

  • Das entscheidest du getrennt davon, ob du in Antworten erscheinst. GPTBot sammelt Inhalte, die zum Training von Modellen genutzt werden können; die ChatGPT-Suche nutzt OAI-SearchBot. Du kannst GPTBot blockieren und OAI-SearchBot zulassen.

  • Eine Garantie gibt es nicht. Der Zugriff ist die Mindestvoraussetzung: Danach entscheidet die KI je nach Frage, welche Quellen sie nutzt. Ob du erscheinst, zeigt nur die Messung echter Antworten.

  • Laut Google steuert Google-Extended, ob deine Inhalte zum Training von Gemini und für Grounding genutzt werden, und hat keinen Einfluss auf deine Aufnahme in die Google Suche. Google-Extended ist kein eigener Crawler, sondern ein Name, den Google in der robots.txt liest.

  • Laut Standard ist eine fehlende Datei dasselbe wie keine Regeln: Crawler dürfen alles abrufen. Das ist kein Fehler, aber du verschenkst die Chance, deine Sitemap und deine Entscheidungen anzugeben.

  • Der Standard verlangt von Crawlern: Antwortet robots.txt mit einem Serverfehler, sollen sie annehmen, dass sie nichts abrufen dürfen. Google behandelt eine 429-Antwort genauso. Als Erstes solltest du diesen Fehler beheben.

Dein nächster Schrittbeginnt hier

Starte deine 7-tägige Testphase: echte Messungen deiner Prompts, keine Abbuchung bis Tag 8, jederzeit kündbar.

7 Tage kostenlos testen

Starte mit einem kostenlosen Check deiner Marke

  • Gemessen für Spanien, auf Spanisch
  • Jede Zahl mit ihrer Antwort und ihrer Quelle
  • Nichts wird ohne deine Freigabe veröffentlicht