# Análisis de logs de rastreadores de IA: qué buscan de verdad GPTBot y ClaudeBot

> Lee los logs del servidor para GPTBot, ClaudeBot y PerplexityBot: huecos de cobertura, rastreo desperdiciado, bloqueos y prueba de que llegan a tu contenido.

_Source: https://seomatrix.ai/ru/blog/ai-crawler-logs/ · Updated: 2026-07-23_

---

En corto: tus **logs de acceso del servidor** son la única verdad sobre lo que los rastreadores de IA hacen realmente en tu sitio. Todo lo demás — robots.txt, sitemaps, «ya añadí llms.txt» — es intención. La línea del log es prueba: nombra al bot, la URL, el código de estado y el número de bytes. Filtra esas líneas por GPTBot, ClaudeBot, PerplexityBot y compañía, y cuatro preguntas se responden solas: ¿llegan a tus páginas de dinero, desperdician presupuesto en basura, están bloqueados y son peticiones reales siquiera?

## Los user agents que vale la pena filtrar

No todos los bots de IA hacen el mismo trabajo. Unos rastrean en masa para armar un corpus; otros piden una sola página en el instante en que un usuario hace una pregunta. Leer bien los logs empieza por saber quién es quién.

| User agent | Operador | Qué hace |
|---|---|---|
| `GPTBot` | OpenAI | Rastreo masivo para entrenamiento/datos |
| `OAI-SearchBot` | OpenAI | Construye el índice de búsqueda de ChatGPT |
| `ChatGPT-User` | OpenAI | Petición bajo demanda — un usuario preguntó |
| `ClaudeBot` | Anthropic | Rastreo masivo para Claude |
| `Claude-User` | Anthropic | Petición bajo demanda dentro de un chat de Claude |
| `PerplexityBot` | Perplexity | Indexación para respuestas de Perplexity |
| `Googlebot` + `Google-Extended` | Google | Rastreo gobernado por el token Extended (ver abajo) |

Un pico de `ChatGPT-User` o `Claude-User` sobre una URL es una señal en vivo: alguien le está preguntando a una IA sobre ese tema y esta pide tu página para responder. Eso merece más atención que el volumen bruto de rastreo masivo.

## Qué dice una sola línea del log

Una única línea del log de acceso lleva cuatro campos que importan para GEO:

- **Ruta** — qué URL se pidió. Agrégalas y obtienes la cobertura.
- **Estado** — 200 (servido), 304 (sin cambios), 403 (bloqueado), 404 (ausente), 5xx (roto). Un bot que solo recibe 403 nunca te ve.
- **Bytes** — un 200 que devuelve 800 bytes en un artículo de 4.000 palabras significa que el bot recibió el esqueleto, no el contenido.
- **Frecuencia + marca de tiempo** — cada cuánto y si el re-rastreo sigue tu ritmo de publicación.

## Los cuatro huecos que hay que cazar

**1. Huecos de cobertura.** Agrupa las peticiones con éxito (200) por ruta y compáralas con tu sitemap. Las páginas que los bots nunca piden son invisibles para las respuestas de IA por buenas que sean. Las víctimas habituales son las páginas profundas y mal enlazadas: un problema de presupuesto de rastreo y enlazado interno, no de contenido.

**2. Rastreo desperdiciado.** Cuenta las peticiones que caen en redirecciones (cadenas 301/302), 404, URLs de filtros facetados o paginación infinita. Cada una es presupuesto que el bot no gastó en una página real. En un sitio grande, ahí se esconde la mayor parte del rastreo de IA desperdiciado.

**3. Respuestas bloqueadas o delgadas.** Un 403 significa que algo — una regla del WAF, un limitador de tasa o robots.txt — está echando a los bots. Recuentos de bytes pequeños en páginas grandes significan que el bot pidió un HTML que se renderiza vacío. Como la mayoría de los rastreadores de IA no ejecutan JavaScript, una SPA renderizada en cliente se lee en los logs como una página en blanco.

**4. Verificación.** Confirma que las peticiones son genuinas antes de confiar en todo lo anterior.

> **Google-Extended es un token, no un rastreador** — No encontrarás una línea `Google-Extended` en tus logs. Google-Extended es un token de control de robots.txt que gobierna si el contenido que Googlebot ya pidió puede usarse para Gemini y Vertex AI — la petición la sigue haciendo el `Googlebot` normal. Por eso bloquear Google-Extended no reduce el tráfico de rastreo; solo cambia el permiso. Lee tus logs por `Googlebot` y gestiona la decisión de uso por IA aparte, en robots.txt.

## Verifica que el bot es real

La cadena del user agent la reporta el propio cliente y falsificarla es trivial — los scrapers se hacen pasar por GPTBot de forma rutinaria para esquivar bloqueos. Antes de sacar una sola conclusión, confirma la IP de origen:

- **OpenAI, Anthropic y Google publican los rangos de IP** de sus rastreadores como listas legibles por máquina contra las que puedes contrastar.
- **El reverse DNS confirmado hacia adelante** es el respaldo: resuelve la IP a la inversa, comprueba que apunta al dominio del operador y luego resuelve ese hostname de vuelta a la misma IP.

Sáltate esto y tu informe de «cobertura de GPTBot» podría estar contando un scraper con el nombre de GPTBot puesto.

> **No actúes sobre logs sin verificar** — Un recuento de user agent sin verificar es peor que no tener datos: parece autorizado y está equivocado. Una queja de «nos bloquean», un pánico de «nos rastrean de más» y un arreglo de hueco de cobertura pueden rastrearse todos hasta un impostor si te saltas la verificación de IP. Verifica primero, decide después.

## La checklist

- [ ] Logs filtrados por GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
- [ ] Cada bot verificado por IP de origen (rangos publicados o rDNS confirmado hacia adelante).
- [ ] Rutas con 200 comparadas con el sitemap — listadas las páginas nunca rastreadas.
- [ ] Rastreo desperdiciado contado: cadenas de redirección, 404, URLs facetadas, paginación.
- [ ] Marcados los 403 y las respuestas delgadas (pocos bytes en páginas grandes).
- [ ] Comprobado que la frecuencia de re-rastreo sigue tu ritmo de publicación.
- [ ] Separadas las peticiones bajo demanda (ChatGPT-User / Claude-User) como señal de interés en vivo.

El reparto es lo importante: cuando casi la mitad del rastreo cae en redirecciones y callejones sin salida, el arreglo no es más contenido — es limpiar las rutas en las que los bots desperdician presupuesto. Nuestra [herramienta de análisis de logs de rastreadores de IA](/es/tools/ai-crawler-log) hace esa pasada por ti: parsea los logs, verifica cada bot y te devuelve las listas de huecos de cobertura y de rastreo desperdiciado.

## En corto

- Los logs del servidor son la única prueba de lo que los rastreadores de IA piden de verdad; el resto es intención.
- Filtra por GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Googlebot; trata las peticiones bajo demanda como interés en vivo.
- Lee ruta, estado, bytes y frecuencia para hallar huecos de cobertura, rastreo desperdiciado y páginas bloqueadas o delgadas.
- Google-Extended es un token de robots, no una línea del log: la petición la sigue haciendo Googlebot.
- Verifica cada bot por IP antes de confiar en las cifras; los user agents se falsifican con trivialidad.

## Fuentes

- **OpenAI, docs de «GPTBot» y «OAI-SearchBot»** — [platform.openai.com/docs/bots](https://platform.openai.com/docs/bots): user agents oficiales y rangos de IP publicados de los rastreadores.
- **Google Search Central, «Overview of Google crawlers and fetchers»** — [developers.google.com/search/docs/crawling-indexing/overview-google-crawlers](https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers): confirma que Google-Extended es un token de robots aplicado a Googlebot, no un rastreador aparte.
- **RFC 9309, «Robots Exclusion Protocol»** — [rfc-editor.org/rfc/rfc9309](https://www.rfc-editor.org/rfc/rfc9309): el estándar que rige cómo se interpretan los tokens de user agent y las directivas.
- Relacionado: [por qué las SPA quedan a oscuras para los rastreadores de IA](/es/blog/geo-for-spa/) y [gestionar los bots de IA en robots.txt](/es/blog/ai-bots-robots/).

## FAQ

### ¿Qué user agents de rastreadores de IA debo buscar en los logs?

Los principales en 2026 son GPTBot y OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) y Googlebot, gobernado por el token robots Google-Extended. ChatGPT-User y Claude-User son las peticiones bajo demanda que se disparan cuando una persona hace una pregunta: señalan interés en vivo, no rastreo masivo.

### ¿Cómo verifico que una línea del log es realmente GPTBot y no un impostor?

Nunca confíes solo en la cadena del user agent — falsificarla es trivial. OpenAI, Anthropic y Google publican los rangos de IP que usan sus rastreadores. Confirma que la IP de origen de cada petición cae dentro del rango oficial publicado (o pasa un reverse DNS confirmado hacia adelante) antes de contarla como un bot real.

### ¿Renderizan JavaScript los rastreadores de IA como Googlebot?

En su mayoría no. La mayoría de los rastreadores de entrenamiento y de respuestas piden HTML crudo y no ejecutan JavaScript del cliente, así que una página que solo se renderiza en el navegador suele estar vacía para ellos. Los logs lo hacen visible: verás el HTML pedido pero nunca el JSON ni el bundle de hidratación que necesitaría un navegador.

