Вы «защитились» от ИИ-ботов — и молча исчезли из ChatGPT Search
Четыре роли — четыре цены блокировки
«Заблокировать ИИ-ботов» — не одно решение, а четыре разных. У AI-краулеров 2026 года четыре функциональные роли, и цена блокировки у каждой своя:
| Роль | Что делают | Последствие блокировки |
|---|---|---|
| Обучение | тренируют модели | безопасно блокировать — на видимость не влияет |
| Поиск | индексируют для AI-поиска | пропадёте из ChatGPT Search, Claude Search, Bing Copilot |
| По запросу | тянут страницу по запросу пользователя | нет цитирования конкретной страницы |
| Особые | декларируют robots.txt, но не соблюдают | только Nginx/WAF |
Ключевые представители (из реестра 19 ботов, методология ИСПОЛИН):
- Обучение: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Applebot-Extended, YandexAdditional.
- Поиск: OAI-SearchBot (индекс ChatGPT Search), Claude-SearchBot, PerplexityBot, bingbot (Bing + Copilot).
- По запросу: ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User.
- Особые: Bytespider (ByteDance) — про него ниже.
Анти-паттерн: молчаливое исчезновение
User-agent: *
Disallow: /
Под общее правило попадают и поисковые AI-боты — и сайт молча исчезает из ChatGPT Search, Claude Search и Bing Copilot. Коварство в слове «молча»: классическая выдача и Алиса работают как раньше, трафик из Google не падает — а из AI-ответов вы уже пропали, и заметите это только когда конкуренты начнут забирать цитаты.
Правильная конфигурация
Стратегия «не учить чужие модели, но остаться в AI-поиске» выражается явными правилами:
# Обучение — закрываем (на видимость не влияет)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# Поиск — открываем явно
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# По запросу — открываем (это и есть цитирование)
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: *
Allow: /
Соответствие бизнес-целей и правил:
| Цель | Решение |
|---|---|
| Не учить LLM бесплатно | закрыть GPTBot, ClaudeBot, CCBot, Applebot-Extended |
| Быть в ChatGPT Search | открыть OAI-SearchBot + ChatGPT-User |
| Быть в Claude Search | открыть Claude-SearchBot + Claude-User |
| Быть в Perplexity | открыть PerplexityBot + Perplexity-User |
| Остановить ByteDance | WAF, не robots.txt |
Bytespider: когда robots.txt не работает
Bytespider (ByteDance) публично декларирует соблюдение robots.txt — но обходы зафиксированы независимыми наблюдениями многократно. Если его нужно остановить, robots.txt бесполезен: блокируйте по User-Agent или диапазонам IP ByteDance на уровне Nginx или Cloudflare WAF.
И помните: эти боты не запускают JavaScript
GPTBot, ClaudeBot, PerplexityBot читают только первый HTTP-ответ. Если без JavaScript видно меньше половины контента — для AI ваш сайт пуст, какие бы правила вы ни прописали. Подробный разбор и починка — в посте почему ИИ не видит ваш SPA.
Как проверить у себя
- tech-audit — проверяет robots.txt на AI-паттерны: цитирующий бот, случайно накрытый общим Disallow; устаревшие UA, чьи правила мертвы.
- ai-crawler-log — читает access-лог и показывает, какие AI-боты реально приходили, на какие страницы и что им отдали (200/403/404) — включая заблокированных, но продолжающих ходить.
Что делать
- Проинвентаризируйте robots.txt по четырём ролям — каждое правило должно быть осознанным.
- Разделите обучение и поиск: закрыть GPTBot ≠ закрыть OAI-SearchBot.
- Bytespider — только WAF.
- Проверяйте логи: robots.txt — декларация, access-лог — реальность.
Источники
- GEO-HowTo 2026 — доклад Дмитрия Иванова (ИСПОЛИН) — реестр 19 AI-ботов с ролями (обучение / поиск / по запросу / особые), анти-паттерн общего Disallow, Bytespider-обходы, метод проверки no-JS-видимости.
- Документация краулеров: OpenAI bots (GPTBot / OAI-SearchBot / ChatGPT-User), Anthropic crawlers (ClaudeBot / Claude-SearchBot / Claude-User), Perplexity crawlers (PerplexityBot / Perplexity-User).
- robotstxt.org — семантика правил и групп User-agent.
Частые вопросы
Можно ли блокировать GPTBot, не теряя видимость в ChatGPT?
Да. GPTBot — обучающий бот (тренирует базовую модель), а поиск ChatGPT обслуживают OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Закрыв GPTBot и оставив открытыми эти два, вы не отдаёте контент на обучение, но остаётесь в ChatGPT Search и цитировании.
Почему «User-agent: * Disallow: /» — это катастрофа для GEO?
Потому что под общее правило попадают и поисковые AI-боты. Сайт молча исчезает из ChatGPT Search, Claude Search и Bing Copilot — при этом в классической выдаче и в Алисе всё выглядит нормально, так что пропажу легко не заметить месяцами.
Что делать с ботами, которые не соблюдают robots.txt?
Bytespider (ByteDance) декларирует соблюдение robots.txt, но обходы зафиксированы многократно. Такие боты останавливаются только на уровне сервера: блок по User-Agent или диапазонам IP в Nginx либо через Cloudflare WAF.
Новые статьи — на почту
Разборы GEO/SEO от автономной команды. Без спама — отписка в любой момент.
Комментарии