Respuesta corta: los proveedores de IA usan rastreadores distintos para fines distintos. Unos alimentan la búsqueda (para que tu web pueda aparecer y citarse en ChatGPT, Perplexity o Claude); otros recogen contenido para entrenar modelos; otros actúan cuando un usuario pide abrir una página concreta. Puedes bloquear el entrenamiento y permitir la búsqueda, o al revés. Lo que no conviene es bloquear «todo lo que suene a IA» con una regla genérica y después preguntarte por qué no apareces.

Los rastreadores, según sus propias documentaciones

ProveedorBúsqueda (permitir si quieres aparecer)Entrenamiento (decisión aparte)A petición del usuario
OpenAI (ChatGPT)OAI-SearchBotGPTBotChatGPT-User; según OpenAI, las reglas de robots.txt pueden no aplicarse porque actúa a petición del usuario
Anthropic (Claude)Claude-SearchBotClaudeBotClaude-User
PerplexityPerplexityBot; su documentación indica que no se usa para entrenar modelos(no documentado como tal)Perplexity-User; su documentación indica que generalmente ignora robots.txt
Google (AI Overviews, AI Mode, Gemini)Googlebot, el mismo de la BúsquedaGoogle-Extended controla el uso para entrenar Gemini y para grounding, y no afecta a la inclusión en la Búsqueda
Microsoft (Copilot)Bingbot

Los nombres cambian y los proveedores actualizan sus políticas; las fuentes al pie son las páginas oficiales en el momento de escribir esto.

Cómo decidir

Si quieres aparecer en la búsqueda con IA: permite OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot y Bingbot. Cualquier web pública puede aparecer en la búsqueda de ChatGPT; si bloqueas su rastreador de búsqueda, no.

Si no quieres que tu contenido entrene modelos: bloquea GPTBot, ClaudeBot y Google-Extended. Es una decisión legítima e independiente. Bloquear Google-Extended no afecta a tu presencia en la Búsqueda de Google, según su documentación.

Sobre los agentes «a petición del usuario»: actúan cuando una persona pide a la IA que abra tu página. Varios proveedores indican que estas peticiones pueden no respetar robots.txt. Si necesitas bloquearlos de verdad, hazlo en el servidor o el CDN, sabiendo que también bloqueas a usuarios reales que quieren leerte.

Ejemplo de robots.txt

Permitir búsqueda y bloquear entrenamiento:

  • User-agent: GPTBot → Disallow: /
  • User-agent: ClaudeBot → Disallow: /
  • User-agent: Google-Extended → Disallow: /
  • User-agent: OAI-SearchBot → Allow: /
  • User-agent: Claude-SearchBot → Allow: /
  • User-agent: PerplexityBot → Allow: /

Y, por supuesto, no bloquees las páginas públicas para User-agent: * ni las esconde tras un noindex que el rastreador no puede leer porque robots.txt le impide entrar.

Errores frecuentes

  1. Una regla «Disallow: /» para todo lo que contiene «bot» o «GPT», que arrastra la búsqueda.
  2. Bloquear en robots.txt y añadir noindex en la página: el rastreador no puede leer el noindex si no puede entrar.
  3. Reglas del CDN o del firewall que devuelven 403 a los rastreadores de IA sin que nadie lo sepa. Revisa los logs.
  4. Confiar en que un archivo llms.txt sustituye a todo esto. No lo hace, y Google indica que no lo necesita.

Cómo comprobarlo

Abre tudominio.es/robots.txt y lee las reglas. Revisa en el servidor o el CDN qué códigos devuelven las peticiones de esos user-agents. Y después mide: si tras permitir los rastreadores de búsqueda tu web sigue sin aparecer en semanas, el problema no era el acceso.

Siguiente paso

Si no sabes si tu web deja entrar a los rastreadores que importan, dínoslo en la revisión gratuita: es lo primero que comprobamos.