# Te 'protegiste' de los bots de IA — y desapareciste en silencio de ChatGPT Search

> Los crawlers de IA cumplen 4 roles distintos, y bloquear cada uno tiene su propio precio. El registro 2026 de 19 bots, el antipatrón #1 de robots.txt y la configuración correcta.

_Source: https://seomatrix.ai/ru/blog/ai-bots-robots/ · Updated: 2026-07-09_

---

## Cuatro roles — cuatro precios distintos

"Bloquear los bots de IA" no es una sola decisión — son cuatro. Los crawlers de IA de 2026 cumplen cuatro roles funcionales, y bloquear cada uno cuesta algo diferente:

| Rol | Qué hacen | Consecuencia de bloquearlos |
|---|---|---|
| **Entrenamiento** | entrenan los modelos | **seguro bloquearlos** — sin impacto en la visibilidad |
| **Búsqueda** | indexan para la búsqueda con IA | desapareces de ChatGPT Search, Claude Search, Bing Copilot |
| **Bajo demanda** | traen una página a pedido del usuario | tu página específica no puede ser citada |
| **Rogue** | declaran robots.txt, pero no lo respetan | solo Nginx/WAF |

Los nombres clave (del registro de 19 bots, metodología ISPOLIN):

- **Entrenamiento**: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Applebot-Extended, YandexAdditional.
- **Búsqueda**: OAI-SearchBot (el índice de ChatGPT Search), Claude-SearchBot, PerplexityBot, bingbot (Bing + Copilot).
- **Bajo demanda**: ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User.
- **Rogue**: Bytespider (ByteDance) — más abajo.

## El antipatrón: una desaparición silenciosa

```
User-agent: *
Disallow: /
```

La regla comodín también cubre a los bots de búsqueda con IA — y el sitio **desaparece en silencio** de ChatGPT Search, Claude Search y Bing Copilot. La traición está en el "en silencio": los resultados clásicos siguen funcionando, el tráfico de Google no cae — pero ya no estás en las respuestas de IA, y solo lo notarás cuando los competidores empiecen a acumular tus citas.

> **Revisa esto ahora mismo** — Si tu robots.txt tiene un Disallow amplio con unos pocos Allow puntuales, comprueba si también cubre a OAI-SearchBot y Claude-SearchBot. Es el hallazgo más común de nuestra auditoría técnica: al bloquear el entrenamiento, los sitios bloquean también la búsqueda por accidente.

## La configuración correcta

La estrategia "no entrenar los modelos de otros, pero seguir en la búsqueda con IA" se expresa con reglas explícitas:

```
# Entrenamiento — bloquear (sin impacto en la visibilidad)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

# Búsqueda — permitir explícitamente
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Bajo demanda — permitir (esto ES la cita)
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /
```

Objetivos de negocio mapeados a reglas:

| Objetivo | Acción |
|---|---|
| No entrenar LLMs gratis | bloquear GPTBot, ClaudeBot, CCBot, Applebot-Extended |
| Estar en ChatGPT Search | permitir OAI-SearchBot + ChatGPT-User |
| Estar en Claude Search | permitir Claude-SearchBot + Claude-User |
| Estar en Perplexity | permitir PerplexityBot + Perplexity-User |
| Detener a ByteDance | WAF, no robots.txt |

## Bytespider: cuando robots.txt no funciona

Bytespider (ByteDance) declara públicamente que respeta robots.txt — pero observaciones independientes han registrado omisiones en repetidas ocasiones. Si necesitas detenerlo, robots.txt es inútil: bloquéalo por User-Agent o por rangos de IP de ByteDance en Nginx, o con una regla de Cloudflare WAF.

## Y recuerda: estos bots no ejecutan JavaScript

GPTBot, ClaudeBot y PerplexityBot leen **solo la primera respuesta HTTP**. Si menos de la mitad de tu contenido es visible sin JavaScript, tu sitio está vacío para la IA — no importa qué reglas escribas. El desglose completo y la solución: [por qué la IA no puede ver tu SPA](/blog/geo-for-spa/).

## Cómo revisar tu propio sitio

- **tech-audit** — revisa robots.txt en busca de los patrones de IA: un bot de citas cubierto por accidente por un Disallow amplio; UAs obsoletos cuyas reglas están muertas.
- **ai-crawler-log** — lee el log de acceso y muestra qué bots de IA **realmente vinieron**, a qué páginas y qué se les sirvió (200/403/404) — incluidos los bloqueados que siguen tocando la puerta.

> **Revísalo en 2 minutos** — Pasa tu sitio por la [revisión gratuita](https://seomatrix.ai/audit) — el bloque de crawlers de IA muestra a quién permites, a quién bloqueas y si un Disallow comodín se tragó a los bots de búsqueda.

## Qué hacer

1. **Inventaría tu robots.txt** en los cuatro roles — cada regla debe ser deliberada.
2. **Separa el entrenamiento de la búsqueda**: bloquear GPTBot ≠ bloquear OAI-SearchBot.
3. **Bytespider — solo WAF.**
4. **Revisa los logs**: robots.txt es una declaración; el log de acceso es la realidad.

## Fuentes

- **GEO-HowTo 2026 — charla de Dmitry Ivanov (ISPOLIN)** — el registro de 19 bots con roles (entrenamiento / búsqueda / bajo demanda / rogue), el antipatrón del Disallow comodín, las omisiones de Bytespider, la prueba de visibilidad sin JS.
- **Documentación de crawlers**: [bots de OpenAI](https://platform.openai.com/docs/bots) (GPTBot / OAI-SearchBot / ChatGPT-User), [crawlers de Anthropic](https://docs.anthropic.com) (ClaudeBot / Claude-SearchBot / Claude-User), [crawlers de Perplexity](https://docs.perplexity.ai) (PerplexityBot / Perplexity-User).
- **[robotstxt.org](https://www.robotstxt.org)** — grupo User-agent y semántica de las reglas.

## FAQ

### ¿Puedo bloquear GPTBot sin perder visibilidad en ChatGPT?

Sí. GPTBot es un bot de entrenamiento (alimenta el modelo base), mientras que la búsqueda de ChatGPT funciona con OAI-SearchBot (el índice) y ChatGPT-User (que trae una página a pedido del usuario). Bloquea GPTBot y mantén esos dos abiertos: dejas de donar contenido para entrenamiento, pero sigues en ChatGPT Search y en las citas.

### ¿Por qué 'User-agent: * Disallow: /' es una catástrofe para el GEO?

Porque la regla comodín también cubre a los bots de búsqueda con IA. El sitio desaparece en silencio de ChatGPT Search, Claude Search y Bing Copilot — mientras que los resultados de búsqueda clásicos se ven perfectamente normales, así que la pérdida puede pasar inadvertida durante meses.

### ¿Qué pasa con los bots que ignoran robots.txt?

Bytespider (ByteDance) declara que respeta robots.txt, pero se han registrado omisiones en repetidas ocasiones. Ese tipo de bots solo se pueden detener a nivel de servidor: un bloqueo por User-Agent o por rangos de IP de ByteDance en Nginx, o una regla de Cloudflare WAF.

