# Indexabilidad

_Fuente: https://seomatrix.ai/es/tools/indexability/_

---

## Qué hace

La indexabilidad es si los buscadores y los rastreadores de IA tienen permiso real para indexar una página y mostrarla en los resultados; la controlan la etiqueta meta-robots, la cabecera HTTP X-Robots-Tag, la etiqueta canonical y las reglas de robots.txt. Una página puede estar en el sitemap, cargar rápido y superar cualquier auditoría de contenido y, aun así, una sola directiva noindex la deja fuera de Google — y de los motores de respuesta con IA que se apoyan en un índice de búsqueda. La comprobación solicita la página como Googlebot y como los bots de IA (GPTBot, PerplexityBot, ClaudeBot) y muestra cada directiva que bloquea o redirige la indexación.

## Qué revisa

- **noindex en meta-robots** — La etiqueta <meta name="robots" content="noindex"> en el head retira la página del índice sin importar la calidad del contenido; es la causa silenciosa más común de que páginas correctas desaparezcan.
- **Cabecera X-Robots-Tag** — Una directiva noindex (o none) enviada en la cabecera de la respuesta HTTP hace lo mismo que la etiqueta meta, pero no aparece en el código fuente, así que es fácil pasarla por alto.
- **Etiqueta canonical** — El rel=canonical indica a los motores qué URL es la autoritativa; uno que apunta a otra URL les dice que indexen esa en lugar de la página que revisas.
- **Acceso en robots.txt** — Una regla Disallow impide que el rastreador llegue a descargar la página, y lo que no se puede descargar no se puede leer, indexar ni citar.
- **Acceso para bots de IA** — GPTBot, PerplexityBot, ClaudeBot y Google-Extended obedecen sus propias reglas en robots.txt, por lo que una página abierta a Googlebot puede estar cerrada a los rastreadores que alimentan las respuestas de IA.
- **Rastreabilidad para Googlebot** — El código de estado y las directivas que se devuelven específicamente al user-agent de Googlebot, ya que los servidores a veces tratan a los bots de forma distinta que al navegador.

## Cómo usarla

1. Pega la URL de tu página y ejecuta la comprobación.
2. Revisa las directivas señaladas: cualquier noindex, canonical a otro dominio o Disallow mostrado por cada rastreador.
3. Corrige el bloqueo en su origen (elimina la directiva de la etiqueta meta o la cabecera, ajusta el canonical o edita robots.txt) y vuelve a ejecutar la comprobación para confirmar que la página es indexable.

## Preguntas

### Mi página carga bien pero no aparece en Google, ¿por qué?

Una página visualmente perfecta puede llevar una directiva noindex en su etiqueta meta o en la cabecera X-Robots-Tag, o estar bloqueada en robots.txt; esta comprobación indica cuál es el caso.

### ¿Qué diferencia hay entre robots.txt y noindex?

robots.txt controla si un rastreador puede descargar una página, mientras que noindex permite la descarga pero pide a los motores que no la indexen. Además, a una página bloqueada en robots.txt ni siquiera se le puede comunicar el noindex, así que un Disallow de más puede dejar la URL indexada sin descripción.

### ¿Los motores de IA como ChatGPT y Perplexity siguen las mismas reglas?

Obedecen sus propios user-agents en robots.txt (GPTBot, PerplexityBot, ClaudeBot, Google-Extended), por lo que una página indexable por Google puede ser invisible para las respuestas de IA; esta herramienta comprueba cada bot por separado.

### ¿Puede una etiqueta canonical impedir que se indexe mi página?

Directamente no, pero un canonical que apunta a otra URL indica a los motores que indexen esa en su lugar, de modo que un canonical incorrecto puede desindexar de hecho la página que querías posicionar.

