# Validador de robots.txt

_Fuente: https://seomatrix.ai/es/tools/robots-validator/_

---

## Qué hace

Un validador de robots.txt analiza el archivo de texto en la raíz de tu dominio que indica a los rastreadores qué rutas pueden rastrear, y señala reglas peligrosas —como un bloqueo accidental de todo el sitio— u obsoletas que los motores de búsqueda y de IA ya no respetan. Como ChatGPT, Perplexity y los rastreadores de Google leen robots.txt antes de acceder a cualquier página, un simple `Disallow: /` olvidado puede volver todo tu sitio invisible para los motores que de otro modo te citarían. Esta comprobación detecta esos errores y las señales que faltan —como la línea Sitemap— antes de que te cuesten rastreo y citaciones.

## Qué revisa

- **Bloqueo de todo el sitio (Disallow: /)** — Un `Disallow: /` bajo `User-agent: *` impide a todos los rastreadores acceder al sitio entero; es la línea más dañina y suele ser una configuración de staging subida a producción por error.
- **Falta la directiva Sitemap** — La línea `Sitemap:` dirige a los rastreadores directamente al índice de tus URL; es opcional pero recomendable, y su ausencia obliga a los motores a descubrir las páginas por la vía lenta.
- **Errores de sintaxis y campos** — Los campos mal escritos (p. ej. `Dissalow`) o las líneas malformadas se ignoran en silencio, así que una regla que crees que protege una ruta puede no existir en absoluto.
- **Directiva Crawl-delay** — `Crawl-delay` es ignorado por Google y la mayoría de rastreadores de IA —solo algunos motores lo respetan—, por lo que confiar en él para limitar los bots da una falsa sensación de control.
- **Directivas obsoletas** — Directivas como `Noindex` o `Nofollow` dentro de robots.txt no están soportadas; no tienen efecto y deben ir en metaetiquetas o cabeceras HTTP.

## Cómo usarla

1. Pega el contenido de tu robots.txt o introduce la URL de tu sitio para cargar el archivo en vivo.
2. Revisa las reglas señaladas: bloqueo de todo el sitio, errores de sintaxis, directivas obsoletas o no soportadas y la falta de la línea Sitemap.
3. Corrige las reglas peligrosas en tu robots.txt, publícalo en /robots.txt y vuelve a ejecutar la validación para confirmar que está limpio.

## Preguntas

### ¿Cuál es el error más peligroso en robots.txt?

Un `Disallow: /` accidental bajo `User-agent: *`: bloquea a todos los rastreadores del sitio entero, así que nada se indexa ni se cita. Suele ser una regla de staging que llegó a producción.

### ¿Bloquea robots.txt a los rastreadores de IA como GPTBot y PerplexityBot?

Sí. Los rastreadores de IA leen robots.txt primero, así que un bloqueo de todo el sitio o de un bot concreto impide que ChatGPT, Perplexity y motores similares lean y citen tus páginas.

### ¿Sigue siendo compatible Crawl-delay?

Google y la mayoría de rastreadores de IA ignoran `Crawl-delay`; solo algunos motores como Bing siguen respetándolo (Yandex abandonó la directiva en favor de un ajuste de velocidad de rastreo en Yandex.Webmaster). El validador lo señala para que no confíes en una directiva que no hace nada donde más importa.

### ¿Puede robots.txt ocultar una página de Google?

No: robots.txt controla el rastreo, no la indexación. Una URL bloqueada puede aparecer igual en los resultados sin descripción; para sacarla del índice, usa una metaetiqueta `noindex`.

