Respuesta corta: los proveedores de IA usan rastreadores distintos para fines distintos. Unos alimentan la búsqueda (para que tu web pueda aparecer y citarse en ChatGPT, Perplexity o Claude); otros recogen contenido para entrenar modelos; otros actúan cuando un usuario pide abrir una página concreta. Puedes bloquear el entrenamiento y permitir la búsqueda, o al revés. Lo que no conviene es bloquear «todo lo que suene a IA» con una regla genérica y después preguntarte por qué no apareces.
Los rastreadores, según sus propias documentaciones
| Proveedor | Búsqueda (permitir si quieres aparecer) | Entrenamiento (decisión aparte) | A petición del usuario |
|---|---|---|---|
| OpenAI (ChatGPT) | OAI-SearchBot | GPTBot | ChatGPT-User; según OpenAI, las reglas de robots.txt pueden no aplicarse porque actúa a petición del usuario |
| Anthropic (Claude) | Claude-SearchBot | ClaudeBot | Claude-User |
| Perplexity | PerplexityBot; su documentación indica que no se usa para entrenar modelos | (no documentado como tal) | Perplexity-User; su documentación indica que generalmente ignora robots.txt |
| Google (AI Overviews, AI Mode, Gemini) | Googlebot, el mismo de la Búsqueda | Google-Extended controla el uso para entrenar Gemini y para grounding, y no afecta a la inclusión en la Búsqueda | |
| Microsoft (Copilot) | Bingbot |
Los nombres cambian y los proveedores actualizan sus políticas; las fuentes al pie son las páginas oficiales en el momento de escribir esto.
Cómo decidir
Si quieres aparecer en la búsqueda con IA: permite OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot y Bingbot. Cualquier web pública puede aparecer en la búsqueda de ChatGPT; si bloqueas su rastreador de búsqueda, no.
Si no quieres que tu contenido entrene modelos: bloquea GPTBot, ClaudeBot y Google-Extended. Es una decisión legítima e independiente. Bloquear Google-Extended no afecta a tu presencia en la Búsqueda de Google, según su documentación.
Sobre los agentes «a petición del usuario»: actúan cuando una persona pide a la IA que abra tu página. Varios proveedores indican que estas peticiones pueden no respetar robots.txt. Si necesitas bloquearlos de verdad, hazlo en el servidor o el CDN, sabiendo que también bloqueas a usuarios reales que quieren leerte.
Ejemplo de robots.txt
Permitir búsqueda y bloquear entrenamiento:
- User-agent: GPTBot → Disallow: /
- User-agent: ClaudeBot → Disallow: /
- User-agent: Google-Extended → Disallow: /
- User-agent: OAI-SearchBot → Allow: /
- User-agent: Claude-SearchBot → Allow: /
- User-agent: PerplexityBot → Allow: /
Y, por supuesto, no bloquees las páginas públicas para User-agent: * ni las esconde tras un noindex que el rastreador no puede leer porque robots.txt le impide entrar.
Errores frecuentes
- Una regla «Disallow: /» para todo lo que contiene «bot» o «GPT», que arrastra la búsqueda.
- Bloquear en robots.txt y añadir noindex en la página: el rastreador no puede leer el noindex si no puede entrar.
- Reglas del CDN o del firewall que devuelven 403 a los rastreadores de IA sin que nadie lo sepa. Revisa los logs.
- Confiar en que un archivo llms.txt sustituye a todo esto. No lo hace, y Google indica que no lo necesita.
Cómo comprobarlo
Abre tudominio.es/robots.txt y lee las reglas. Revisa en el servidor o el CDN qué códigos devuelven las peticiones de esos user-agents. Y después mide: si tras permitir los rastreadores de búsqueda tu web sigue sin aparecer en semanas, el problema no era el acceso.
Siguiente paso
Si no sabes si tu web deja entrar a los rastreadores que importan, dínoslo en la revisión gratuita: es lo primero que comprobamos.