llms.txt — por qué tu sitio necesita uno y cómo construirlo
llms.txt es un archivo en la raíz de tu sitio (/llms.txt) que le da a los motores de IA un mapa curado de tu contenido en Markdown: qué es lo importante del sitio y dónde vive. No es robots.txt (acceso) ni sitemap.xml (una lista completa de URL para los crawlers) — es la “hoja de portada para la IA”.
Por qué importa
Los modelos de lenguaje están limitados por el contexto y el tiempo de lectura. sitemap.xml enumera todas las URL sin prioridad ni contexto. llms.txt responde a una pregunta distinta: “si tienes poco tiempo, lee estas, en este orden”. La curación y el Markdown legible por humanos son la diferencia clave.
En qué se diferencia de sitemap.xml y robots.txt
| sitemap.xml | robots.txt | llms.txt | |
|---|---|---|---|
| Audiencia | crawlers de búsqueda | bots (acceso) | motores / agentes de IA |
| Formato | XML, todas las URL | directivas | Markdown, seleccionadas |
| Función | rastrear cada página | permitir/denegar | qué vale la pena leer |
| Contexto | ninguno | ninguno | título + descripción |
Ninguno compite — cada uno tiene su propio rol. llms.txt complementa, no reemplaza.
Cómo se ve llms.txt
# Nombre del sitio
> Una o dos frases: qué es el sitio y para quién es.
## Secciones principales
- [Servicios](https://site.tld/services/): qué y para quién
- [Blog](https://site.tld/blog/): enfoques sobre el tema
## Opcional
- [Acerca de](https://site.tld/about/)
- [Contacto](https://site.tld/contact/)
La estructura según la especificación de llmstxt.org: un título H1, una descripción en blockquote, secciones de enlaces del tipo “URL: nota breve” y páginas secundarias bajo ## Optional.
Cómo agregarlo — paso a paso
- Agrupa las páginas en clústeres semánticos, cada uno con una descripción breve (una línea por enlace).
- Separa las secundarias (legales, utilitarias) en
## Optional. - Mantenlo compacto: resumen ≤ 80 palabras, no cien enlaces — es un mapa, no un catálogo.
- Coloca
/llms.txten la raíz, junto arobots.txt(sírvelo comotext/plain). - Opcionalmente, construye
/llms-full.txtcon el texto completo de los artículos clave en orden de clúster.
Errores comunes
- Un duplicado de sitemap.xml — volcar todas las URL sin descripciones. llms.txt trata de prioridad y significado, no de exhaustividad.
- Demasiado largo — un muro de cientos de enlaces consume el contexto del modelo.
- Sin descripciones — sin un “de qué trata esta página”, un enlace es inútil para la IA.
- Olvidar actualizarlo — tras un rediseño/migración los enlaces se pudren, igual que un sitemap.
Vale la pena hacerlo ahora
Todavía no es un estándar obligatorio, y no todos los motores lo leen. Pero cuesta minutos, no hace daño, y una lista creciente de herramientas ya lo soporta. Es un seguro barato: cuando un motor decida leer llms.txt, ya tendrás uno — con las prioridades correctas.
Quién lee tu sitio, y cómo
Los bots de IA no son un solo “robot”. Conviene dividirlos en tres clases, y bloquearlos deliberadamente:
- Entrenamiento (se pueden bloquear sin perder visibilidad):
GPTBot(OpenAI),ClaudeBot(Anthropic),CCBot(Common Crawl),Google-Extended,Applebot-Extended. - Búsqueda / citación (si los bloqueas, desapareces de las respuestas):
OAI-SearchBot(ChatGPT Search),PerplexityBot,Claude-SearchBot,bingbot(Bing/Copilot). - Por demanda del usuario:
ChatGPT-User,Claude-User,Perplexity-User— buscan una página cuando una persona le pide a la IA que la abra.
Un error común: un solo Disallow bajo GPTBot que por accidente también atrapa a OAI-SearchBot — bloqueaste el entrenamiento y perdiste la citación junto con él.
Dos hechos técnicos sobre por qué la legibilidad por máquina es crítica:
- Los crawlers de IA no ejecutan JavaScript.
GPTBot/ClaudeBot/PerplexityBotven solo la primera respuesta HTML — el contenido renderizado en el cliente está vacío para ellos. Necesitas renderizado del lado del servidor. - Los datos estructurados alimentan el Knowledge Graph. Según los materiales de US v. Google, muchas funciones y entidades provienen del marcado y del Knowledge Graph, no del rastreo de la página. Schema.org + llms.txt le dan a la máquina una estructura explícita, en lugar de depender de la recuperación para “adivinar”.
En resumen
- llms.txt = un mapa del sitio curado, en Markdown, para la IA.
- No reemplaza a sitemap.xml ni a robots.txt — los complementa.
- Los bots son de entrenamiento / citación / bajo demanda — no bloquees por accidente los de citación.
- La IA no ejecuta JS → necesitas SSR; Schema.org alimenta el Knowledge Graph.
- llms-full.txt = todo el contenido clave en un solo archivo para una única solicitud.
Fuentes
- llmstxt.org — la especificación del formato llms.txt / llms-full.txt.
- schema.org — tipos de datos estructurados (Article, FAQPage, Product…).
- Registro de bots de IA (GEO-HowTo 2026) — clasificación de crawlers por rol (entrenamiento / búsqueda / bajo demanda) y comportamiento (JS, robots.txt).
- US v. Google, materiales del caso (2025) — el papel del Knowledge Graph y de los datos estructurados en el ensamblaje de respuestas.
Preguntas frecuentes
¿En qué se diferencia llms.txt de sitemap.xml?
sitemap.xml es una lista para máquinas con todas las URL destinada a los crawlers de búsqueda. llms.txt es una lista curada en Markdown que incluye solo las páginas importantes con descripciones, y que los motores de IA leen para entender rápidamente el sitio.
¿Dónde coloco llms.txt?
En la raíz del sitio: /llms.txt. Opcionalmente, agrega /llms-full.txt junto a él — el texto completo de las páginas clave para una ingesta en una sola solicitud.
¿Vale la pena hacerlo ahora?
El estándar es joven y todavía no garantiza tráfico, pero es barato, inofensivo y prepara el sitio para la ingesta por IA — una apuesta razonable de cara al futuro.
Recibe las nuevas publicaciones por correo
Guías de GEO/SEO del equipo autónomo. Sin spam: cancela tu suscripción cuando quieras.
Comentarios