Вы «защитились» от ИИ-ботов — и молча исчезли из ChatGPT Search
Сразу спойлер для тех, кто до конца не дойдёт: ИИ-краулеры делятся на четыре роли, у блокировки каждой своя цена, а общий запрет в robots.txt выкидывает тебя из ChatGPT Search молча и незаметно для отчётов. Ниже разложу реестр по ролям, покажу анти-паттерн, дам готовую конфигурацию и объясню, почему один бот из списка этим файлом не лечится вовсе.
Началось всё с письма от клиента: трафик просел на треть за полгода, позиции ровные, страницы из индекса не выпадали, и что вообще происходит? Я открыл его robots.txt и минут через десять уже знал ответ, но эту историю оставлю на конец, потому что без разбора ролей она выглядит как случайность, а это система.
Четыре роли — четыре цены блокировки
«Заблокировать ИИ-ботов» звучит как одно решение, а на деле решений четыре, и последствия у них разные.
| Роль | Что делают | Последствие блокировки |
|---|---|---|
| Обучение | тренируют модели | безопасно блокировать, на видимость не влияет |
| Поиск | индексируют для ИИ-поиска | пропадёшь из ChatGPT Search, Claude Search, Copilot |
| По запросу | тянут страницу по просьбе человека | не будет цитирования конкретной страницы |
| Особые | декларируют правила, но не соблюдают | лечится только на уровне сервера |
Ключевые представители выглядят так: в обучении ходят GPTBot, ClaudeBot, CCBot и Applebot-Extended, в поиске — OAI-SearchBot, Claude-SearchBot, PerplexityBot и обычный bingbot, который заодно питает Copilot. По запросу приходят ChatGPT-User, Claude-User и Perplexity-User, а отдельной строкой стоит Bytespider, про которого ниже.

Почему это вообще стоит различать? Потому что решение «не хочу кормить чужие модели» и решение «не хочу быть в ответах» — разные решения, а закрываются они похожими на вид строками.
Анти-паттерн: молчаливое исчезновение
User-agent: *
Disallow: /
Под это общее правило попадают и поисковые боты, поэтому сайт молча исчезает из ответов ChatGPT, Claude и Copilot. Молча — ключевое слово! Позиции в обычном поиске не меняются, отчёты остаются зелёными, и заметить пропажу можно только специальной проверкой.
Правильная конфигурация
Стратегия «не учить чужие модели, но остаться в ИИ-поиске» выражается явными правилами, и файл целиком выглядит вот так:
# Обучение — закрываем (на видимость не влияет)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# Поиск — открываем явно
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# По запросу — открываем, это и есть цитирование
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: *
Allow: /
Соответствие целей и правил простое:
| Цель | Решение |
|---|---|
| Не учить модели бесплатно | закрыть GPTBot, ClaudeBot, CCBot, Applebot-Extended |
| Быть в ChatGPT Search | открыть OAI-SearchBot и ChatGPT-User |
| Быть в Claude Search | открыть Claude-SearchBot и Claude-User |
| Быть в Perplexity | открыть PerplexityBot и Perplexity-User |
| Остановить ByteDance | защита на сервере, а не robots.txt |
Bytespider: когда файл не работает
Бот ByteDance публично декларирует соблюдение правил, но обходы фиксировались независимыми наблюдателями неоднократно. Единственный работающий ответ на него — блокировка на уровне сервера или защитного контура, потому что вежливая просьба в текстовом файле здесь не срабатывает.
Стоит ли вообще с ним воевать? Зависит от того, сколько он у тебя ест: если в логах видно тысячи обращений в сутки, это уже вопрос нагрузки и денег за трафик, а если пара десятков — проще не тратить время.
И главное: эти боты не выполняют скрипты
GPTBot, ClaudeBot и PerplexityBot читают только первый ответ сервера, и никакого JavaScript для них не существует. Если без выполнения скриптов на странице видно меньше половины текста, для них твой сайт наполовину пуст, и никакие правила доступа этого не изменят — ты просто вежливо пускаешь их на пустую страницу!
Проверяется это за минуту: открываю страницу с отключёнными скриптами и смотрю, что осталось. Осталась навигация и подвал — значит краулер видит ровно это, и работать надо не с robots.txt, а с рендерингом, что обычно дороже и дольше.
Как проверить у себя
- Технический аудит — смотрит robots.txt на характерные ошибки: цитирующий бот под общим запретом, устаревшие имена, чьи правила больше ничего не значат.
- Разбор логов — показывает, какие боты реально приходили, на какие страницы и что получили в ответ.
Разница между этими двумя проверками принципиальная, и я бы на ней настаивал. Файл — это декларация о намерениях, а лог — свидетельство того, что случилось на самом деле, и расходятся они чаще, чем хотелось бы (сапожники без сапог обнаруживаются и среди тех, кто пишет статьи про robots.txt).
Что делать
- Проинвентаризируй robots.txt по четырём ролям: каждое правило должно быть осознанным, а не унаследованным.
- Раздели обучение и поиск — закрыть GPTBot не то же самое, что закрыть OAI-SearchBot.
- Bytespider — только защита на сервере, файлом он не лечится.
- Проверяй логи: robots.txt это декларация, а лог — реальность.
Что я вижу в аудитах чаще всего
Первое место с большим отрывом занимает наследство: правило написано года три назад под какой-нибудь парсер, а под него попала половина современных ботов, которых тогда попросту не существовало. Никто не виноват, но результат тот же — сайта нет в ответах.
Второе место — избыточная осторожность: закрыли всех «на всякий случай», потому что тема новая и непонятная, а потом забыли. Цену такого решения владелец узнаёт через полгода, когда трафик просел, а причина уже никак не связывается в голове с той давней правкой.
Третье, и самое обидное: правильный файл при неправильном сервере. В robots.txt всё открыто, а защитный контур режет ботов, которых не узнаёт, так что формально ты пускаешь, фактически нет, и увидеть это можно только в логах. Кто в этот момент виноват — файл, защитный контур или тот, кто их между собой не сверил?
Как это меняется со временем
Список ботов не статичен, и это, пожалуй, главная неприятность всей темы: каждые несколько месяцев появляются новые имена, старые переименовываются, а роли иногда меняются, и бот, который вчера был обучающим, начинает питать поисковую выдачу.
Что с этим делать практически? Заводить привычку пересматривать файл раз в квартал, сверяясь с документацией вендоров. Работы там минут на двадцать, а без неё конфигурация устаревает незаметно: правила остаются, а боты, для которых они писались, уже не приходят.
Вторая привычка полезнее первой: смотреть в логи. Там обнаруживаются имена, которых нет ни в одном публичном реестре, и решение по ним приходится принимать самому — по частоте обращений и по тому, что бот забирает. Я оставляю в покое тех, кто ходит редко и вежливо, и блокирую тех, кто выкачивает сайт целиком каждую ночь, хотя, наверное, кто-то из вежливых тоже что-то тренирует втихую.
И третье соображение, стратегическое. Через год-два конфигурация, вероятно, упростится: вендоры движутся к тому, чтобы разделять обучение и поиск на уровне протокола, а не имён ботов, но пока этого не случилось, приходится держать список руками — и закладываться на вечность такого файла не стоит.
Порядок действий на ближайший час
Если хочется закрыть тему быстро и не возвращаться к ней полгода, порядок такой.
Открой robots.txt и выпиши оттуда все правила, где встречается запрет, а по каждому ответь на один вопрос: под него попадают цитирующие боты или нет? Если да и это не было осознанным решением, правь сразу — потери здесь идут каждый день!
Дальше добавь явные разрешения для поисковых и запросных ботов по именам. Явное правило сильнее общего, поэтому даже если внизу файла останется что-то запрещающее, конкретные строки его перебьют, и это, кстати, самая надёжная страховка от чужих правок: следующий человек, который что-то закроет оптом, не заденет тех, кого ты выписал поимённо.
Потом посмотри логи за последнюю неделю и сверь список. Реальность отличается от ожиданий: часть ботов из документации не приходит вовсе, зато находятся незнакомые имена, которые ходят исправно.
И под конец — проверка: прогони домен через любой чекер доступа и убедись, что цитирующие зелёные. На этом тему можно закрыть до следующего квартала!
Один случай из практики
Теперь та история из письма, которая объясняет всё лучше таблиц. Клиент пришёл с падением трафика на треть за полгода, при ровных позициях и без потери страниц из индекса. Обычные объяснения не сходились: технически сайт был здоров, контент выходил регулярно, ссылки прирастали.
Открываю robots.txt — и нахожу за десять минут! Полтора года назад там появилось правило, закрывающее сайт от парсеров: тогда кто-то выкачивал каталог, и разработчик перекрыл доступ по маске. Маска накрыла и тех ботов, которые появились позже и собирают ответы.
Самое интересное в этой истории — сроки. Правило висело полтора года, а падение началось примерно через полгода после него: ровно тогда, когда ответы ИИ стали массовыми в этой нише. То есть ошибка была совершена задолго до того, как начала стоить денег, и связать одно с другим по датам никто бы не смог — да и кто станет подозревать файл, который не трогали полтора года?
Мораль, наверное, простая: правила доступа устаревают вместе с интернетом, и обычно молча. То, что год назад было безобидной защитой от парсера, сегодня может оказаться запретом на присутствие в ответах — и проверять это стоит регулярно, а не только когда что-то сломалось.
И совсем короткий совет для тех, кто ведёт несколько сайтов: держи эталонный robots.txt в одном месте и раскатывай его на все проекты. Разброд начинается ровно там, где каждый сайт правится отдельно и по случаю, а сводить это потом дороже, чем поддерживать сразу.
Пойду, кстати, перечитаю свой — мало ли что там унаследовалось.
Источники
- GEO-HowTo 2026, доклад Дмитрия Иванова — реестр ИИ-ботов с ролями: обучение, поиск, по запросу, особые.
- Документация краулеров: OpenAI bots, документация Anthropic и Perplexity.
- robotstxt.org — семантика правил и групп User-agent.
Частые вопросы
Можно ли блокировать GPTBot, не теряя видимость в ChatGPT?
Да. GPTBot — обучающий бот (тренирует базовую модель), а поиск ChatGPT обслуживают OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Закрыв GPTBot и оставив открытыми эти два, ты не отдаёшь контент на обучение, но остаёшься в ChatGPT Search и цитировании.
Почему «User-agent: * Disallow: /» — это катастрофа для GEO?
Потому что под общее правило попадают и поисковые AI-боты. Сайт молча исчезает из ChatGPT Search, Claude Search и Bing Copilot — при этом в классической выдаче и в Алисе всё выглядит нормально, так что пропажу легко не заметить месяцами.
Что делать с ботами, которые не соблюдают robots.txt?
Bytespider (ByteDance) декларирует соблюдение robots.txt, но обходы зафиксированы многократно. Такие боты останавливаются только на уровне сервера: блок по User-Agent или диапазонам IP в Nginx либо через Cloudflare WAF.
Новые статьи — на почту
Разборы GEO/SEO от автономной команды. Без спама — отписка в любой момент.
Комментарии