← Todos los artículos

Análisis de logs de rastreadores de IA: qué buscan de verdad GPTBot y ClaudeBot

· 6 min de lectura · Autor Mikhail Kuzmitskii

GEOrastreadores de IAanálisis de logsSEO técnico

Ver como Markdown ↗

Análisis de logs de rastreadores de IA: qué buscan de verdad GPTBot y ClaudeBot

En corto: tus logs de acceso del servidor son la única verdad sobre lo que los rastreadores de IA hacen realmente en tu sitio. Todo lo demás — robots.txt, sitemaps, «ya añadí llms.txt» — es intención. La línea del log es prueba: nombra al bot, la URL, el código de estado y el número de bytes. Filtra esas líneas por GPTBot, ClaudeBot, PerplexityBot y compañía, y cuatro preguntas se responden solas: ¿llegan a tus páginas de dinero, desperdician presupuesto en basura, están bloqueados y son peticiones reales siquiera?

Los user agents que vale la pena filtrar

No todos los bots de IA hacen el mismo trabajo. Unos rastrean en masa para armar un corpus; otros piden una sola página en el instante en que un usuario hace una pregunta. Leer bien los logs empieza por saber quién es quién.

User agentOperadorQué hace
GPTBotOpenAIRastreo masivo para entrenamiento/datos
OAI-SearchBotOpenAIConstruye el índice de búsqueda de ChatGPT
ChatGPT-UserOpenAIPetición bajo demanda — un usuario preguntó
ClaudeBotAnthropicRastreo masivo para Claude
Claude-UserAnthropicPetición bajo demanda dentro de un chat de Claude
PerplexityBotPerplexityIndexación para respuestas de Perplexity
Googlebot + Google-ExtendedGoogleRastreo gobernado por el token Extended (ver abajo)

Un pico de ChatGPT-User o Claude-User sobre una URL es una señal en vivo: alguien le está preguntando a una IA sobre ese tema y esta pide tu página para responder. Eso merece más atención que el volumen bruto de rastreo masivo.

Qué dice una sola línea del log

Una única línea del log de acceso lleva cuatro campos que importan para GEO:

  • Ruta — qué URL se pidió. Agrégalas y obtienes la cobertura.
  • Estado — 200 (servido), 304 (sin cambios), 403 (bloqueado), 404 (ausente), 5xx (roto). Un bot que solo recibe 403 nunca te ve.
  • Bytes — un 200 que devuelve 800 bytes en un artículo de 4.000 palabras significa que el bot recibió el esqueleto, no el contenido.
  • Frecuencia + marca de tiempo — cada cuánto y si el re-rastreo sigue tu ritmo de publicación.

Los cuatro huecos que hay que cazar

1. Huecos de cobertura. Agrupa las peticiones con éxito (200) por ruta y compáralas con tu sitemap. Las páginas que los bots nunca piden son invisibles para las respuestas de IA por buenas que sean. Las víctimas habituales son las páginas profundas y mal enlazadas: un problema de presupuesto de rastreo y enlazado interno, no de contenido.

2. Rastreo desperdiciado. Cuenta las peticiones que caen en redirecciones (cadenas 301/302), 404, URLs de filtros facetados o paginación infinita. Cada una es presupuesto que el bot no gastó en una página real. En un sitio grande, ahí se esconde la mayor parte del rastreo de IA desperdiciado.

3. Respuestas bloqueadas o delgadas. Un 403 significa que algo — una regla del WAF, un limitador de tasa o robots.txt — está echando a los bots. Recuentos de bytes pequeños en páginas grandes significan que el bot pidió un HTML que se renderiza vacío. Como la mayoría de los rastreadores de IA no ejecutan JavaScript, una SPA renderizada en cliente se lee en los logs como una página en blanco.

4. Verificación. Confirma que las peticiones son genuinas antes de confiar en todo lo anterior.

Verifica que el bot es real

La cadena del user agent la reporta el propio cliente y falsificarla es trivial — los scrapers se hacen pasar por GPTBot de forma rutinaria para esquivar bloqueos. Antes de sacar una sola conclusión, confirma la IP de origen:

  • OpenAI, Anthropic y Google publican los rangos de IP de sus rastreadores como listas legibles por máquina contra las que puedes contrastar.
  • El reverse DNS confirmado hacia adelante es el respaldo: resuelve la IP a la inversa, comprueba que apunta al dominio del operador y luego resuelve ese hostname de vuelta a la misma IP.

Sáltate esto y tu informe de «cobertura de GPTBot» podría estar contando un scraper con el nombre de GPTBot puesto.

La checklist

  • Logs filtrados por GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
  • Cada bot verificado por IP de origen (rangos publicados o rDNS confirmado hacia adelante).
  • Rutas con 200 comparadas con el sitemap — listadas las páginas nunca rastreadas.
  • Rastreo desperdiciado contado: cadenas de redirección, 404, URLs facetadas, paginación.
  • Marcados los 403 y las respuestas delgadas (pocos bytes en páginas grandes).
  • Comprobado que la frecuencia de re-rastreo sigue tu ritmo de publicación.
  • Separadas las peticiones bajo demanda (ChatGPT-User / Claude-User) como señal de interés en vivo.
Adónde va el presupuesto de rastreo de IA en un sitio grande sin auditar (ilustrativo)
Páginas de contenido (200) 45%
Redirecciones / 404 / facetas 40%
Assets y otros 15%

источник: auditorías internas, 2026

El reparto es lo importante: cuando casi la mitad del rastreo cae en redirecciones y callejones sin salida, el arreglo no es más contenido — es limpiar las rutas en las que los bots desperdician presupuesto. Nuestra herramienta de análisis de logs de rastreadores de IA hace esa pasada por ti: parsea los logs, verifica cada bot y te devuelve las listas de huecos de cobertura y de rastreo desperdiciado.

En corto

  • Los logs del servidor son la única prueba de lo que los rastreadores de IA piden de verdad; el resto es intención.
  • Filtra por GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Googlebot; trata las peticiones bajo demanda como interés en vivo.
  • Lee ruta, estado, bytes y frecuencia para hallar huecos de cobertura, rastreo desperdiciado y páginas bloqueadas o delgadas.
  • Google-Extended es un token de robots, no una línea del log: la petición la sigue haciendo Googlebot.
  • Verifica cada bot por IP antes de confiar en las cifras; los user agents se falsifican con trivialidad.

Fuentes

Preguntas frecuentes

¿Qué user agents de rastreadores de IA debo buscar en los logs?

Los principales en 2026 son GPTBot y OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) y Googlebot, gobernado por el token robots Google-Extended. ChatGPT-User y Claude-User son las peticiones bajo demanda que se disparan cuando una persona hace una pregunta: señalan interés en vivo, no rastreo masivo.

¿Cómo verifico que una línea del log es realmente GPTBot y no un impostor?

Nunca confíes solo en la cadena del user agent — falsificarla es trivial. OpenAI, Anthropic y Google publican los rangos de IP que usan sus rastreadores. Confirma que la IP de origen de cada petición cae dentro del rango oficial publicado (o pasa un reverse DNS confirmado hacia adelante) antes de contarla como un bot real.

¿Renderizan JavaScript los rastreadores de IA como Googlebot?

En su mayoría no. La mayoría de los rastreadores de entrenamiento y de respuestas piden HTML crudo y no ejecutan JavaScript del cliente, así que una página que solo se renderiza en el navegador suele estar vacía para ellos. Los logs lo hacen visible: verás el HTML pedido pero nunca el JSON ni el bundle de hidratación que necesitaría un navegador.

¿Te fue útil?
Lanza SEO/GEO con seo·matrix → o una solicitud sin Telegram →

Comentarios

Los comentarios se moderan.