# robots.txt apto para IA

_Fuente: https://seomatrix.ai/es/tools/robots-generator/_

---

## Qué hace

El robots.txt es un archivo de texto en la raíz del dominio que indica a cada rastreador —tanto buscadores como motores de respuesta con IA— qué URLs puede descargar. Este generador crea un robots.txt que mantiene permitidos los rastreadores que te interesan (Googlebot, Bingbot, OAI-SearchBot, PerplexityBot) para que tus páginas se indexen y se citen en las respuestas de IA, y que opcionalmente bloquea los rastreadores de entrenamiento de IA que no quieres. Un error en las reglas puede hacerte desaparecer en silencio de ChatGPT, Perplexity y los resúmenes de Google (AI Overviews).

## Qué revisa

- **User-agents de buscadores** — Reglas específicas para Googlebot y Bingbot; permitirlos es lo que abre el acceso a los índices de los que se nutren tanto la búsqueda clásica como las AI Overviews de Google.
- **Rastreadores de respuestas con IA** — Bots como OAI-SearchBot (búsqueda de ChatGPT), PerplexityBot y Claude-SearchBot descargan páginas en vivo para citarlas en sus respuestas, así que bloquearlos te elimina por completo de esas citas.
- **Rastreadores de entrenamiento de IA** — GPTBot, CCBot y Google-Extended recopilan texto para entrenar modelos, y puedes bloquearlos por separado sin perder visibilidad en búsqueda ni en citas.
- **Separación entre cita y entrenamiento** — Los bots de respuesta y los de entrenamiento son user-agents distintos, así que un robots.txt correcto puede permitir la cita y negar el entrenamiento del modelo, el movimiento clave que la mayoría de sitios pasa por alto.
- **Directiva Sitemap** — Una línea Sitemap: que apunta a tu XML sitemap ayuda a cada rastreador a descubrir todas tus URLs en una sola pasada en lugar de depender del seguimiento de enlaces.
- **Rutas en Disallow** — Las reglas Disallow explícitas dejan fuera el panel de administración, el carrito y las URLs duplicadas para que los rastreadores gasten su presupuesto de rastreo en las páginas que de verdad quieres que se citen.

## Cómo usarla

1. Elige qué rastreadores permitir y si bloquear los bots de entrenamiento de IA, y genera el archivo.
2. Copia o descarga el robots.txt generado y súbelo a la raíz de tu dominio en /robots.txt.
3. Verifica que carga en tudominio.com/robots.txt y vuelve a revisarlo tras cualquier cambio de CMS o de hosting.

## Preguntas

### ¿Bloquear GPTBot impide que ChatGPT cite mi sitio?

No. GPTBot es el rastreador de entrenamiento de OpenAI; las citas en vivo de ChatGPT las trae OAI-SearchBot. Bloquea GPTBot y permite OAI-SearchBot para conservar las citas y a la vez renunciar al entrenamiento.

### ¿Dónde va el robots.txt?

En la raíz del dominio, accesible en https://tudominio.com/robots.txt. Solo rige el host donde está alojado, así que cada subdominio necesita su propio archivo.

### ¿El robots.txt oculta una página de los resultados de búsqueda?

No de forma fiable. Disallow impide el rastreo, pero una página puede indexarse igualmente si otros sitios la enlazan; usa una etiqueta o cabecera noindex para mantenerla fuera de los resultados.

### ¿Conviene bloquear a los rastreadores de IA?

Solo a los de entrenamiento, y solo si no quieres que tu contenido se use para entrenar modelos. Bloquear rastreadores de respuesta como PerplexityBot te saca de las respuestas de IA, lo que suele costar más visibilidad de la que protege.

