Te 'protegiste' de los bots de IA — y desapareciste en silencio de ChatGPT Search
Cuatro roles — cuatro precios distintos
“Bloquear los bots de IA” no es una sola decisión — son cuatro. Los crawlers de IA de 2026 cumplen cuatro roles funcionales, y bloquear cada uno cuesta algo diferente:
| Rol | Qué hacen | Consecuencia de bloquearlos |
|---|---|---|
| Entrenamiento | entrenan los modelos | seguro bloquearlos — sin impacto en la visibilidad |
| Búsqueda | indexan para la búsqueda con IA | desapareces de ChatGPT Search, Claude Search, Bing Copilot |
| Bajo demanda | traen una página a pedido del usuario | tu página específica no puede ser citada |
| Rogue | declaran robots.txt, pero no lo respetan | solo Nginx/WAF |
Los nombres clave (del registro de 19 bots, metodología ISPOLIN):
- Entrenamiento: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Applebot-Extended, YandexAdditional.
- Búsqueda: OAI-SearchBot (el índice de ChatGPT Search), Claude-SearchBot, PerplexityBot, bingbot (Bing + Copilot).
- Bajo demanda: ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User.
- Rogue: Bytespider (ByteDance) — más abajo.
El antipatrón: una desaparición silenciosa
User-agent: *
Disallow: /
La regla comodín también cubre a los bots de búsqueda con IA — y el sitio desaparece en silencio de ChatGPT Search, Claude Search y Bing Copilot. La traición está en el “en silencio”: los resultados clásicos siguen funcionando, el tráfico de Google no cae — pero ya no estás en las respuestas de IA, y solo lo notarás cuando los competidores empiecen a acumular tus citas.
La configuración correcta
La estrategia “no entrenar los modelos de otros, pero seguir en la búsqueda con IA” se expresa con reglas explícitas:
# Entrenamiento — bloquear (sin impacto en la visibilidad)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# Búsqueda — permitir explícitamente
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Bajo demanda — permitir (esto ES la cita)
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: *
Allow: /
Objetivos de negocio mapeados a reglas:
| Objetivo | Acción |
|---|---|
| No entrenar LLMs gratis | bloquear GPTBot, ClaudeBot, CCBot, Applebot-Extended |
| Estar en ChatGPT Search | permitir OAI-SearchBot + ChatGPT-User |
| Estar en Claude Search | permitir Claude-SearchBot + Claude-User |
| Estar en Perplexity | permitir PerplexityBot + Perplexity-User |
| Detener a ByteDance | WAF, no robots.txt |
Bytespider: cuando robots.txt no funciona
Bytespider (ByteDance) declara públicamente que respeta robots.txt — pero observaciones independientes han registrado omisiones en repetidas ocasiones. Si necesitas detenerlo, robots.txt es inútil: bloquéalo por User-Agent o por rangos de IP de ByteDance en Nginx, o con una regla de Cloudflare WAF.
Y recuerda: estos bots no ejecutan JavaScript
GPTBot, ClaudeBot y PerplexityBot leen solo la primera respuesta HTTP. Si menos de la mitad de tu contenido es visible sin JavaScript, tu sitio está vacío para la IA — no importa qué reglas escribas. El desglose completo y la solución: por qué la IA no puede ver tu SPA.
Cómo revisar tu propio sitio
- tech-audit — revisa robots.txt en busca de los patrones de IA: un bot de citas cubierto por accidente por un Disallow amplio; UAs obsoletos cuyas reglas están muertas.
- ai-crawler-log — lee el log de acceso y muestra qué bots de IA realmente vinieron, a qué páginas y qué se les sirvió (200/403/404) — incluidos los bloqueados que siguen tocando la puerta.
Qué hacer
- Inventaría tu robots.txt en los cuatro roles — cada regla debe ser deliberada.
- Separa el entrenamiento de la búsqueda: bloquear GPTBot ≠ bloquear OAI-SearchBot.
- Bytespider — solo WAF.
- Revisa los logs: robots.txt es una declaración; el log de acceso es la realidad.
Fuentes
- GEO-HowTo 2026 — charla de Dmitry Ivanov (ISPOLIN) — el registro de 19 bots con roles (entrenamiento / búsqueda / bajo demanda / rogue), el antipatrón del Disallow comodín, las omisiones de Bytespider, la prueba de visibilidad sin JS.
- Documentación de crawlers: bots de OpenAI (GPTBot / OAI-SearchBot / ChatGPT-User), crawlers de Anthropic (ClaudeBot / Claude-SearchBot / Claude-User), crawlers de Perplexity (PerplexityBot / Perplexity-User).
- robotstxt.org — grupo User-agent y semántica de las reglas.
Preguntas frecuentes
¿Puedo bloquear GPTBot sin perder visibilidad en ChatGPT?
Sí. GPTBot es un bot de entrenamiento (alimenta el modelo base), mientras que la búsqueda de ChatGPT funciona con OAI-SearchBot (el índice) y ChatGPT-User (que trae una página a pedido del usuario). Bloquea GPTBot y mantén esos dos abiertos: dejas de donar contenido para entrenamiento, pero sigues en ChatGPT Search y en las citas.
¿Por qué 'User-agent: * Disallow: /' es una catástrofe para el GEO?
Porque la regla comodín también cubre a los bots de búsqueda con IA. El sitio desaparece en silencio de ChatGPT Search, Claude Search y Bing Copilot — mientras que los resultados de búsqueda clásicos se ven perfectamente normales, así que la pérdida puede pasar inadvertida durante meses.
¿Qué pasa con los bots que ignoran robots.txt?
Bytespider (ByteDance) declara que respeta robots.txt, pero se han registrado omisiones en repetidas ocasiones. Ese tipo de bots solo se pueden detener a nivel de servidor: un bloqueo por User-Agent o por rangos de IP de ByteDance en Nginx, o una regla de Cloudflare WAF.
Recibe las nuevas publicaciones por correo
Guías de GEO/SEO del equipo autónomo. Sin spam: cancela tu suscripción cuando quieras.
Comentarios