← Todos los artículos

llms.txt — por qué tu sitio necesita uno y cómo construirlo

· 4 min de lectura · Autor Mikhail Kuzmitskii

llms.txtGEOAEO

Ver como Markdown ↗

llms.txt — por qué tu sitio necesita uno y cómo construirlo

llms.txt es un archivo en la raíz de tu sitio (/llms.txt) que le da a los motores de IA un mapa curado de tu contenido en Markdown: qué es lo importante del sitio y dónde vive. No es robots.txt (acceso) ni sitemap.xml (una lista completa de URL para los crawlers) — es la “hoja de portada para la IA”.

Por qué importa

Los modelos de lenguaje están limitados por el contexto y el tiempo de lectura. sitemap.xml enumera todas las URL sin prioridad ni contexto. llms.txt responde a una pregunta distinta: “si tienes poco tiempo, lee estas, en este orden”. La curación y el Markdown legible por humanos son la diferencia clave.

En qué se diferencia de sitemap.xml y robots.txt

sitemap.xmlrobots.txtllms.txt
Audienciacrawlers de búsquedabots (acceso)motores / agentes de IA
FormatoXML, todas las URLdirectivasMarkdown, seleccionadas
Funciónrastrear cada páginapermitir/denegarqué vale la pena leer
Contextoningunoningunotítulo + descripción

Ninguno compite — cada uno tiene su propio rol. llms.txt complementa, no reemplaza.

Cómo se ve llms.txt

# Nombre del sitio

> Una o dos frases: qué es el sitio y para quién es.

## Secciones principales
- [Servicios](https://site.tld/services/): qué y para quién
- [Blog](https://site.tld/blog/): enfoques sobre el tema

## Opcional
- [Acerca de](https://site.tld/about/)
- [Contacto](https://site.tld/contact/)

La estructura según la especificación de llmstxt.org: un título H1, una descripción en blockquote, secciones de enlaces del tipo “URL: nota breve” y páginas secundarias bajo ## Optional.

Cómo agregarlo — paso a paso

  1. Agrupa las páginas en clústeres semánticos, cada uno con una descripción breve (una línea por enlace).
  2. Separa las secundarias (legales, utilitarias) en ## Optional.
  3. Mantenlo compacto: resumen ≤ 80 palabras, no cien enlaces — es un mapa, no un catálogo.
  4. Coloca /llms.txt en la raíz, junto a robots.txt (sírvelo como text/plain).
  5. Opcionalmente, construye /llms-full.txt con el texto completo de los artículos clave en orden de clúster.

Errores comunes

  • Un duplicado de sitemap.xml — volcar todas las URL sin descripciones. llms.txt trata de prioridad y significado, no de exhaustividad.
  • Demasiado largo — un muro de cientos de enlaces consume el contexto del modelo.
  • Sin descripciones — sin un “de qué trata esta página”, un enlace es inútil para la IA.
  • Olvidar actualizarlo — tras un rediseño/migración los enlaces se pudren, igual que un sitemap.

Vale la pena hacerlo ahora

Todavía no es un estándar obligatorio, y no todos los motores lo leen. Pero cuesta minutos, no hace daño, y una lista creciente de herramientas ya lo soporta. Es un seguro barato: cuando un motor decida leer llms.txt, ya tendrás uno — con las prioridades correctas.

Quién lee tu sitio, y cómo

Los bots de IA no son un solo “robot”. Conviene dividirlos en tres clases, y bloquearlos deliberadamente:

  • Entrenamiento (se pueden bloquear sin perder visibilidad): GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended, Applebot-Extended.
  • Búsqueda / citación (si los bloqueas, desapareces de las respuestas): OAI-SearchBot (ChatGPT Search), PerplexityBot, Claude-SearchBot, bingbot (Bing/Copilot).
  • Por demanda del usuario: ChatGPT-User, Claude-User, Perplexity-User — buscan una página cuando una persona le pide a la IA que la abra.

Un error común: un solo Disallow bajo GPTBot que por accidente también atrapa a OAI-SearchBot — bloqueaste el entrenamiento y perdiste la citación junto con él.

Dos hechos técnicos sobre por qué la legibilidad por máquina es crítica:

  • Los crawlers de IA no ejecutan JavaScript. GPTBot/ClaudeBot/PerplexityBot ven solo la primera respuesta HTML — el contenido renderizado en el cliente está vacío para ellos. Necesitas renderizado del lado del servidor.
  • Los datos estructurados alimentan el Knowledge Graph. Según los materiales de US v. Google, muchas funciones y entidades provienen del marcado y del Knowledge Graph, no del rastreo de la página. Schema.org + llms.txt le dan a la máquina una estructura explícita, en lugar de depender de la recuperación para “adivinar”.

En resumen

  • llms.txt = un mapa del sitio curado, en Markdown, para la IA.
  • No reemplaza a sitemap.xml ni a robots.txt — los complementa.
  • Los bots son de entrenamiento / citación / bajo demanda — no bloquees por accidente los de citación.
  • La IA no ejecuta JS → necesitas SSR; Schema.org alimenta el Knowledge Graph.
  • llms-full.txt = todo el contenido clave en un solo archivo para una única solicitud.

Fuentes

  • llmstxt.org — la especificación del formato llms.txt / llms-full.txt.
  • schema.org — tipos de datos estructurados (Article, FAQPage, Product…).
  • Registro de bots de IA (GEO-HowTo 2026) — clasificación de crawlers por rol (entrenamiento / búsqueda / bajo demanda) y comportamiento (JS, robots.txt).
  • US v. Google, materiales del caso (2025) — el papel del Knowledge Graph y de los datos estructurados en el ensamblaje de respuestas.

Preguntas frecuentes

¿En qué se diferencia llms.txt de sitemap.xml?

sitemap.xml es una lista para máquinas con todas las URL destinada a los crawlers de búsqueda. llms.txt es una lista curada en Markdown que incluye solo las páginas importantes con descripciones, y que los motores de IA leen para entender rápidamente el sitio.

¿Dónde coloco llms.txt?

En la raíz del sitio: /llms.txt. Opcionalmente, agrega /llms-full.txt junto a él — el texto completo de las páginas clave para una ingesta en una sola solicitud.

¿Vale la pena hacerlo ahora?

El estándar es joven y todavía no garantiza tráfico, pero es barato, inofensivo y prepara el sitio para la ingesta por IA — una apuesta razonable de cara al futuro.

¿Te fue útil?
Lanza SEO/GEO con seo·matrix → o una solicitud sin Telegram →

Comentarios

Los comentarios se moderan.