Ir al contenido
Comprobador de rastreadores de IA

¿Pueden entrar los rastreadores de IA en tu web?

Leemos tu robots.txt como lo leen los rastreadores y te decimos, uno a uno, si pueden entrar. Separamos los que alimentan la búsqueda de los que recogen datos para entrenar.

Pedimos los archivos públicos de tu web desde nuestro servidor, como lo haría un rastreador. No guardamos el dominio ni el resultado.

Cómo funciona

Qué hace la herramienta, paso a paso

  1. Paso 1

    Pedimos tu robots.txt

    Desde nuestro servidor pedimos https://tudominio/robots.txt, seguimos hasta tres redirecciones y leemos el archivo como texto.

  2. Paso 2

    Aplicamos las reglas del estándar

    Cada rastreador sigue el grupo con su nombre o, si no hay, el grupo *. Gana la regla más larga que coincide y, si empatan, Allow. Entendemos * y $.

  3. Paso 3

    Te damos el resultado y el arreglo

    Para cada rastreador ves si puede entrar en la raíz y en tu ruta, qué regla lo decide y, si bloqueas uno de búsqueda, el bloque que lo deja pasar.

Alcance

Qué comprueba y qué no te dice

Qué comprueba

  • Quince rastreadores y agentes de OpenAI, Anthropic, Perplexity, Google, Microsoft, Apple, Common Crawl, Meta y ByteDance.
  • La raíz de tu web y la ruta que elijas, con la regla y la línea que deciden.
  • Qué pasa si el archivo no existe, si el servidor falla o si responde con una página HTML.
  • Sitemaps declarados y líneas que los rastreadores no entienden.

Qué no te dice

  • Si un cortafuegos o tu CDN bloquea a un rastreador. robots.txt es una petición, no una barrera; los bloqueos de verdad están en el servidor.
  • Si los agentes que actúan a petición del usuario respetan el archivo. Algunos proveedores indican que no siempre.
  • Si una IA te va a citar. Que un rastreador pueda entrar es necesario, no suficiente.
  • Las metaetiquetas noindex o las cabeceras X-Robots-Tag de cada página. Para eso, el comprobador de datos estructurados mira la página que le des.
Referencia

Qué hace cada rastreador

Según la documentación de cada proveedor. Los nombres y las políticas cambian: las fuentes están al final.

Búsqueda con IA

Permítelos si quieres que tu web pueda aparecer y citarse en las respuestas.

  • OAI-SearchBot (OpenAI). Búsqueda de ChatGPT. Si lo bloqueas, tu web no aparece en ella.
  • Claude-SearchBot (Anthropic). Búsqueda de Claude.
  • PerplexityBot (Perplexity). Búsqueda de Perplexity; su documentación indica que no se usa para entrenar modelos.

Buscadores que alimentan la IA

Googlebot alimenta AI Overviews y AI Mode, y Bingbot a Copilot. Bloquearlos te saca también de la búsqueda.

  • Googlebot (Google). El rastreador de la Búsqueda, también para AI Overviews y AI Mode.
  • Bingbot (Microsoft). El rastreador de Bing, del que bebe Copilot.

Entrenamiento de modelos

Recogen contenido que puede usarse para entrenar. Bloquearlos es una decisión legítima e independiente de aparecer.

  • GPTBot (OpenAI). Recoge contenido que puede usarse para entrenar modelos.
  • ClaudeBot (Anthropic). Entrenamiento de modelos.
  • Google-Extended (Google). No rastrea: es un nombre que Google lee para decidir el uso en Gemini y en grounding. No afecta a la Búsqueda.
  • Applebot-Extended (Apple). No rastrea: según Apple, decide si lo que recoge Applebot puede usarse para entrenar sus modelos.
  • CCBot (Common Crawl). Archivo abierto de la web que se ha usado para entrenar muchos modelos.
  • meta-externalagent (Meta). Según Meta, para usos como entrenar modelos de IA o mejorar productos.

A petición del usuario

Abren una página cuando una persona se lo pide a la IA. Varios proveedores indican que pueden no respetar robots.txt.

  • ChatGPT-User (OpenAI). Actúa a petición del usuario; según OpenAI, las reglas de robots.txt pueden no aplicarse.
  • Claude-User (Anthropic). Actúa cuando un usuario pide a Claude abrir una página.
  • Perplexity-User (Perplexity). A petición del usuario; su documentación indica que generalmente ignora robots.txt.

Otros

Rastreadores sobre los que muchas webs deciden.

  • Bytespider (ByteDance). Rastreador de ByteDance. No enlazamos documentación oficial suya.

Fuentes: OpenAI, rastreadores de OpenAI; Anthropic, rastreadores de Anthropic; Perplexity, rastreadores de Perplexity; Google Search Central, rastreadores comunes de Google; Apple, sobre Applebot; Common Crawl, CCBot; Meta, rastreadores web de Meta; RFC 9309, Robots Exclusion Protocol.

Preguntas

Preguntas frecuentes

Lo que suele preguntarse antes y después de usar la herramienta.

¿No encuentras tu pregunta? Escríbenos

  • Es una decisión aparte de aparecer. GPTBot recoge contenido que puede usarse para entrenar modelos; la búsqueda de ChatGPT usa OAI-SearchBot. Puedes bloquear GPTBot y permitir OAI-SearchBot. Lo explicamos en robots.txt y bots de IA.

  • No hay garantía. Permitir el acceso es la condición mínima: luego la IA decide qué fuentes usa según la pregunta. Para saber si apareces hay que medir respuestas reales.

  • Según Google, Google-Extended controla el uso de tu contenido para entrenar Gemini y para grounding, y no afecta a tu inclusión en la Búsqueda. Google-Extended no es un rastreador aparte: es un nombre que Google lee en robots.txt.

  • Para el estándar, un archivo que no existe equivale a no tener reglas: los rastreadores pueden entrar en todo. No es un error, pero pierdes la ocasión de declarar tu sitemap y tus decisiones.

  • El estándar pide a los rastreadores que, si robots.txt responde con un error del servidor, asuman que no pueden entrar en nada. Google trata igual una respuesta 429. Arreglar ese error es lo primero.

Tu marca merece serla respuesta

Empieza tu prueba de 7 días: mediciones reales de tus preguntas, sin cobro hasta el día 8 y cancelas cuando quieras.

Prueba gratis 7 días

¿Prefieres que lo hagamos nosotros? Pide una revisión gratuita a la agencia

  • Medido para España, en español
  • Cada cifra con su respuesta y su fuente
  • Nada se publica sin tu aprobación