# Acceso de crawlers de IA

_Fuente: https://seomatrix.ai/es/tools/ai-access/_

---

## Qué hace

Comprueba si tu robots.txt permite o bloquea los rastreadores de IA concretos que alimentan los motores de respuesta: GPTBot y OAI-SearchBot (OpenAI), PerplexityBot, ClaudeBot, Google-Extended y otros. Si has puesto en Disallow un bot que recopila o recupera tu contenido para un motor de IA, ese motor no podrá rastrear tus páginas y nunca podrá citarte en sus respuestas. La herramienta separa los bots de entrenamiento de modelos de los bots de búsqueda en vivo, que son los que construyen respuestas con citas.

## Qué revisa

- **coincidencia de user-agent** — El token exacto del bot en robots.txt (por ejemplo, GPTBot, PerplexityBot); las reglas se aplican según la cadena user-agent, así que un error tipográfico hace que la regla no surta efecto sin avisar.
- **directiva Disallow** — Un `Disallow: /` bajo el user-agent de un bot de IA le cierra todo el sitio, y un bot de citación bloqueado no puede descargar ni citar tus páginas.
- **bots de entrenamiento frente a los de recuperación** — GPTBot y Google-Extended sirven al entrenamiento de modelos, mientras que OAI-SearchBot y PerplexityBot recuperan páginas en vivo para responder — bloquear los de recuperación es lo que realmente te cuesta citas.
- **regla comodín general** — El bloque `User-agent: *` se aplica a cualquier bot sin regla propia, por lo que un Disallow amplio puede abarcar sin querer a los rastreadores de IA que querías permitir.
- **excepción con Allow** — Una línea `Allow:` específica bajo un bot de IA puede reabrir una sección dentro de un Disallow más amplio, así que la precedencia de reglas decide si el bot entra.
- **robots.txt ausente o inaccesible** — La falta de robots.txt o una respuesta 4xx (p. ej. 404, y según Google también 403) suele significar «rastreo permitido», mientras que un archivo inaccesible o una respuesta 5xx es lo que Google y la RFC 9309 tratan como bloqueo total temporal.

## Cómo usarla

1. Pega la URL de tu sitio (o la de su robots.txt) y ejecuta la comprobación.
2. Revisa los bots señalados: qué rastreadores de IA están permitidos, cuáles bloqueados y qué regla se aplicó a cada uno.
3. Corrige las reglas de robots.txt que bloquean los bots de citación que quieres que te vean y vuelve a comprobar.

## Preguntas

### ¿Bloquear GPTBot impide que ChatGPT me cite?

Bloquear GPTBot solo impide que OpenAI te rastree para entrenar el modelo; las respuestas web en vivo de ChatGPT usan OAI-SearchBot, así que permite ese bot si quieres aparecer en las citas de ChatGPT Search.

### Si no tengo robots.txt, ¿están permitidos los bots de IA?

Sí — la ausencia de robots.txt se interpreta como «todo permitido», así que por defecto todos los rastreadores de IA pueden acceder a tu sitio.

### ¿Qué diferencia hay entre un bot de entrenamiento y uno de búsqueda?

Los bots de entrenamiento (GPTBot, Google-Extended) recopilan contenido para entrenar modelos, mientras que los de búsqueda/recuperación (OAI-SearchBot, PerplexityBot) obtienen páginas en tiempo real para construir respuestas con citas — estos últimos son los que generan citas de IA directamente.

### ¿Permitir estos bots perjudica mi SEO normal?

No — las reglas para rastreadores de IA son independientes de Googlebot, así que puedes permitir OAI-SearchBot y PerplexityBot sin cambiar cómo Google indexa o posiciona tu sitio.

