seo·matrix
← Все статьи

Вы «защитились» от ИИ-ботов — и молча исчезли из ChatGPT Search

· 8 мин чтения · Автор Михаил Кузьмицкий

GEOAI-краулерыrobots.txtтехническое SEO

Markdown-версия ↗

Сразу спойлер для тех, кто до конца не дойдёт: ИИ-краулеры делятся на четыре роли, у блокировки каждой своя цена, а общий запрет в robots.txt выкидывает тебя из ChatGPT Search молча и незаметно для отчётов. Ниже разложу реестр по ролям, покажу анти-паттерн, дам готовую конфигурацию и объясню, почему один бот из списка этим файлом не лечится вовсе.

Началось всё с письма от клиента: трафик просел на треть за полгода, позиции ровные, страницы из индекса не выпадали, и что вообще происходит? Я открыл его robots.txt и минут через десять уже знал ответ, но эту историю оставлю на конец, потому что без разбора ролей она выглядит как случайность, а это система.

Четыре роли — четыре цены блокировки

«Заблокировать ИИ-ботов» звучит как одно решение, а на деле решений четыре, и последствия у них разные.

РольЧто делаютПоследствие блокировки
Обучениетренируют моделибезопасно блокировать, на видимость не влияет
Поискиндексируют для ИИ-поискапропадёшь из ChatGPT Search, Claude Search, Copilot
По запросутянут страницу по просьбе человекане будет цитирования конкретной страницы
Особыедекларируют правила, но не соблюдаютлечится только на уровне сервера

Ключевые представители выглядят так: в обучении ходят GPTBot, ClaudeBot, CCBot и Applebot-Extended, в поиске — OAI-SearchBot, Claude-SearchBot, PerplexityBot и обычный bingbot, который заодно питает Copilot. По запросу приходят ChatGPT-User, Claude-User и Perplexity-User, а отдельной строкой стоит Bytespider, про которого ниже.

Вы «защитились» от ИИ-ботов — и молча исчезли из ChatGPT Search

Почему это вообще стоит различать? Потому что решение «не хочу кормить чужие модели» и решение «не хочу быть в ответах» — разные решения, а закрываются они похожими на вид строками.

Анти-паттерн: молчаливое исчезновение

User-agent: *
Disallow: /

Под это общее правило попадают и поисковые боты, поэтому сайт молча исчезает из ответов ChatGPT, Claude и Copilot. Молча — ключевое слово! Позиции в обычном поиске не меняются, отчёты остаются зелёными, и заметить пропажу можно только специальной проверкой.

Правильная конфигурация

Стратегия «не учить чужие модели, но остаться в ИИ-поиске» выражается явными правилами, и файл целиком выглядит вот так:

# Обучение — закрываем (на видимость не влияет)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

# Поиск — открываем явно
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# По запросу — открываем, это и есть цитирование
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Соответствие целей и правил простое:

ЦельРешение
Не учить модели бесплатнозакрыть GPTBot, ClaudeBot, CCBot, Applebot-Extended
Быть в ChatGPT Searchоткрыть OAI-SearchBot и ChatGPT-User
Быть в Claude Searchоткрыть Claude-SearchBot и Claude-User
Быть в Perplexityоткрыть PerplexityBot и Perplexity-User
Остановить ByteDanceзащита на сервере, а не robots.txt

Bytespider: когда файл не работает

Бот ByteDance публично декларирует соблюдение правил, но обходы фиксировались независимыми наблюдателями неоднократно. Единственный работающий ответ на него — блокировка на уровне сервера или защитного контура, потому что вежливая просьба в текстовом файле здесь не срабатывает.

Стоит ли вообще с ним воевать? Зависит от того, сколько он у тебя ест: если в логах видно тысячи обращений в сутки, это уже вопрос нагрузки и денег за трафик, а если пара десятков — проще не тратить время.

И главное: эти боты не выполняют скрипты

GPTBot, ClaudeBot и PerplexityBot читают только первый ответ сервера, и никакого JavaScript для них не существует. Если без выполнения скриптов на странице видно меньше половины текста, для них твой сайт наполовину пуст, и никакие правила доступа этого не изменят — ты просто вежливо пускаешь их на пустую страницу!

Проверяется это за минуту: открываю страницу с отключёнными скриптами и смотрю, что осталось. Осталась навигация и подвал — значит краулер видит ровно это, и работать надо не с robots.txt, а с рендерингом, что обычно дороже и дольше.

Как проверить у себя

  • Технический аудит — смотрит robots.txt на характерные ошибки: цитирующий бот под общим запретом, устаревшие имена, чьи правила больше ничего не значат.
  • Разбор логов — показывает, какие боты реально приходили, на какие страницы и что получили в ответ.

Разница между этими двумя проверками принципиальная, и я бы на ней настаивал. Файл — это декларация о намерениях, а лог — свидетельство того, что случилось на самом деле, и расходятся они чаще, чем хотелось бы (сапожники без сапог обнаруживаются и среди тех, кто пишет статьи про robots.txt).

Что делать

  1. Проинвентаризируй robots.txt по четырём ролям: каждое правило должно быть осознанным, а не унаследованным.
  2. Раздели обучение и поиск — закрыть GPTBot не то же самое, что закрыть OAI-SearchBot.
  3. Bytespider — только защита на сервере, файлом он не лечится.
  4. Проверяй логи: robots.txt это декларация, а лог — реальность.

Что я вижу в аудитах чаще всего

Первое место с большим отрывом занимает наследство: правило написано года три назад под какой-нибудь парсер, а под него попала половина современных ботов, которых тогда попросту не существовало. Никто не виноват, но результат тот же — сайта нет в ответах.

Второе место — избыточная осторожность: закрыли всех «на всякий случай», потому что тема новая и непонятная, а потом забыли. Цену такого решения владелец узнаёт через полгода, когда трафик просел, а причина уже никак не связывается в голове с той давней правкой.

Третье, и самое обидное: правильный файл при неправильном сервере. В robots.txt всё открыто, а защитный контур режет ботов, которых не узнаёт, так что формально ты пускаешь, фактически нет, и увидеть это можно только в логах. Кто в этот момент виноват — файл, защитный контур или тот, кто их между собой не сверил?

Как это меняется со временем

Список ботов не статичен, и это, пожалуй, главная неприятность всей темы: каждые несколько месяцев появляются новые имена, старые переименовываются, а роли иногда меняются, и бот, который вчера был обучающим, начинает питать поисковую выдачу.

Что с этим делать практически? Заводить привычку пересматривать файл раз в квартал, сверяясь с документацией вендоров. Работы там минут на двадцать, а без неё конфигурация устаревает незаметно: правила остаются, а боты, для которых они писались, уже не приходят.

Вторая привычка полезнее первой: смотреть в логи. Там обнаруживаются имена, которых нет ни в одном публичном реестре, и решение по ним приходится принимать самому — по частоте обращений и по тому, что бот забирает. Я оставляю в покое тех, кто ходит редко и вежливо, и блокирую тех, кто выкачивает сайт целиком каждую ночь, хотя, наверное, кто-то из вежливых тоже что-то тренирует втихую.

И третье соображение, стратегическое. Через год-два конфигурация, вероятно, упростится: вендоры движутся к тому, чтобы разделять обучение и поиск на уровне протокола, а не имён ботов, но пока этого не случилось, приходится держать список руками — и закладываться на вечность такого файла не стоит.

Порядок действий на ближайший час

Если хочется закрыть тему быстро и не возвращаться к ней полгода, порядок такой.

Открой robots.txt и выпиши оттуда все правила, где встречается запрет, а по каждому ответь на один вопрос: под него попадают цитирующие боты или нет? Если да и это не было осознанным решением, правь сразу — потери здесь идут каждый день!

Дальше добавь явные разрешения для поисковых и запросных ботов по именам. Явное правило сильнее общего, поэтому даже если внизу файла останется что-то запрещающее, конкретные строки его перебьют, и это, кстати, самая надёжная страховка от чужих правок: следующий человек, который что-то закроет оптом, не заденет тех, кого ты выписал поимённо.

Потом посмотри логи за последнюю неделю и сверь список. Реальность отличается от ожиданий: часть ботов из документации не приходит вовсе, зато находятся незнакомые имена, которые ходят исправно.

И под конец — проверка: прогони домен через любой чекер доступа и убедись, что цитирующие зелёные. На этом тему можно закрыть до следующего квартала!

Один случай из практики

Теперь та история из письма, которая объясняет всё лучше таблиц. Клиент пришёл с падением трафика на треть за полгода, при ровных позициях и без потери страниц из индекса. Обычные объяснения не сходились: технически сайт был здоров, контент выходил регулярно, ссылки прирастали.

Открываю robots.txt — и нахожу за десять минут! Полтора года назад там появилось правило, закрывающее сайт от парсеров: тогда кто-то выкачивал каталог, и разработчик перекрыл доступ по маске. Маска накрыла и тех ботов, которые появились позже и собирают ответы.

Самое интересное в этой истории — сроки. Правило висело полтора года, а падение началось примерно через полгода после него: ровно тогда, когда ответы ИИ стали массовыми в этой нише. То есть ошибка была совершена задолго до того, как начала стоить денег, и связать одно с другим по датам никто бы не смог — да и кто станет подозревать файл, который не трогали полтора года?

Мораль, наверное, простая: правила доступа устаревают вместе с интернетом, и обычно молча. То, что год назад было безобидной защитой от парсера, сегодня может оказаться запретом на присутствие в ответах — и проверять это стоит регулярно, а не только когда что-то сломалось.

И совсем короткий совет для тех, кто ведёт несколько сайтов: держи эталонный robots.txt в одном месте и раскатывай его на все проекты. Разброд начинается ровно там, где каждый сайт правится отдельно и по случаю, а сводить это потом дороже, чем поддерживать сразу.

Пойду, кстати, перечитаю свой — мало ли что там унаследовалось.

Источники

  • GEO-HowTo 2026, доклад Дмитрия Иванова — реестр ИИ-ботов с ролями: обучение, поиск, по запросу, особые.
  • Документация краулеров: OpenAI bots, документация Anthropic и Perplexity.
  • robotstxt.org — семантика правил и групп User-agent.

Частые вопросы

Можно ли блокировать GPTBot, не теряя видимость в ChatGPT?

Да. GPTBot — обучающий бот (тренирует базовую модель), а поиск ChatGPT обслуживают OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Закрыв GPTBot и оставив открытыми эти два, ты не отдаёшь контент на обучение, но остаёшься в ChatGPT Search и цитировании.

Почему «User-agent: * Disallow: /» — это катастрофа для GEO?

Потому что под общее правило попадают и поисковые AI-боты. Сайт молча исчезает из ChatGPT Search, Claude Search и Bing Copilot — при этом в классической выдаче и в Алисе всё выглядит нормально, так что пропажу легко не заметить месяцами.

Что делать с ботами, которые не соблюдают robots.txt?

Bytespider (ByteDance) декларирует соблюдение robots.txt, но обходы зафиксированы многократно. Такие боты останавливаются только на уровне сервера: блок по User-Agent или диапазонам IP в Nginx либо через Cloudflare WAF.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

  • …

Комментарии модерируются.