herramienta gratuita

validador de robots.txt

Un robots.txt roto puede desindexar todo tu sitio sin avisar. Pega tu robots.txt o cárgalo desde una URL: lo revisamos en busca de lo peligroso y lo obsoleto. (Para detalles de bots de IA, usa el verificador de acceso de IA.)

    Qué comprueba esta herramienta

    Un validador de robots.txt analiza el archivo de texto en la raíz de tu dominio que indica a los rastreadores qué rutas pueden rastrear, y señala reglas peligrosas —como un bloqueo accidental de todo el sitio— u obsoletas que los motores de búsqueda y de IA ya no respetan. Como ChatGPT, Perplexity y los rastreadores de Google leen robots.txt antes de acceder a cualquier página, un simple `Disallow: /` olvidado puede volver todo tu sitio invisible para los motores que de otro modo te citarían. Esta comprobación detecta esos errores y las señales que faltan —como la línea Sitemap— antes de que te cuesten rastreo y citaciones.

    Qué se evalúa

    Bloqueo de todo el sitio (Disallow: /)
    Un `Disallow: /` bajo `User-agent: *` impide a todos los rastreadores acceder al sitio entero; es la línea más dañina y suele ser una configuración de staging subida a producción por error.
    Falta la directiva Sitemap
    La línea `Sitemap:` dirige a los rastreadores directamente al índice de tus URL; es opcional pero recomendable, y su ausencia obliga a los motores a descubrir las páginas por la vía lenta.
    Errores de sintaxis y campos
    Los campos mal escritos (p. ej. `Dissalow`) o las líneas malformadas se ignoran en silencio, así que una regla que crees que protege una ruta puede no existir en absoluto.
    Directiva Crawl-delay
    `Crawl-delay` es ignorado por Google y la mayoría de rastreadores de IA —solo algunos motores lo respetan—, por lo que confiar en él para limitar los bots da una falsa sensación de control.
    Directivas obsoletas
    Directivas como `Noindex` o `Nofollow` dentro de robots.txt no están soportadas; no tienen efecto y deben ir en metaetiquetas o cabeceras HTTP.

    Cómo usarla

    1. Pega el contenido de tu robots.txt o introduce la URL de tu sitio para cargar el archivo en vivo.
    2. Revisa las reglas señaladas: bloqueo de todo el sitio, errores de sintaxis, directivas obsoletas o no soportadas y la falta de la línea Sitemap.
    3. Corrige las reglas peligrosas en tu robots.txt, publícalo en /robots.txt y vuelve a ejecutar la validación para confirmar que está limpio.

    Preguntas frecuentes

    ¿Cuál es el error más peligroso en robots.txt?

    Un `Disallow: /` accidental bajo `User-agent: *`: bloquea a todos los rastreadores del sitio entero, así que nada se indexa ni se cita. Suele ser una regla de staging que llegó a producción.

    ¿Bloquea robots.txt a los rastreadores de IA como GPTBot y PerplexityBot?

    Sí. Los rastreadores de IA leen robots.txt primero, así que un bloqueo de todo el sitio o de un bot concreto impide que ChatGPT, Perplexity y motores similares lean y citen tus páginas.

    ¿Sigue siendo compatible Crawl-delay?

    Google y la mayoría de rastreadores de IA ignoran `Crawl-delay`; solo algunos motores como Bing siguen respetándolo (Yandex abandonó la directiva en favor de un ajuste de velocidad de rastreo en Yandex.Webmaster). El validador lo señala para que no confíes en una directiva que no hace nada donde más importa.

    ¿Puede robots.txt ocultar una página de Google?

    No: robots.txt controla el rastreo, no la indexación. Una URL bloqueada puede aparecer igual en los resultados sin descripción; para sacarla del índice, usa una metaetiqueta `noindex`.

    compartir el resultado ¿Resultado útil? Compártelo: Telegram WhatsApp X
    esto es solo una herramienta

    Esta auditoría es 1 de 85 operaciones en seo·matrix

    Las herramientas gratuitas te muestran QUÉ corregir. La auditoría completa y el equipo autónomo de 20 agentes de IA lo resuelven de principio a fin: estrategia, contenido, GEO, enlazado interno, publicación y mantenimiento continuo.

    Todas las herramientas gratuitas →