seo·matrix
← Все статьи

Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot

· 8 мин чтения · Автор Михаил Кузьмицкий

Markdown-версия ↗

Спойлер для тех, кто лонгриды не любит: единственное доказательство того, что ИИ-боты реально забирают твои страницы, — серверные логи, а не robots.txt и не красивый llms.txt. В логах ищем четыре дыры (пробелы охвата, слитый бюджет, блокировки, тощие ответы), но сначала проверяем, что бот вообще настоящий, потому что половина отчётов о ботах считает чужой скрапер.

Третьего дня открыл access-лог сайта, для которого старательно сделали всё «для ИИ»: robots.txt открыт, карта на месте, llms.txt лежит в корне и сияет. Отфильтровал по GPTBot — и увидел, что бот приходит стабильно, но забирает исключительно редиректы и страницы фильтров, а до статей не дошёл ни разу. Полез разбираться, и получился этот текст.

Начну с неприятного: всё, что ты настроил для ИИ-ботов — robots.txt, карта сайта, файл llms.txt — это всего лишь заявление о намерениях, а не результат. Сайт таким образом говорит, что готов принять гостей и открыл им дверь, но открытая дверь не значит, что кто-то вошёл.

Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot

Логи сервера отвечают на совсем другой вопрос: кто из гостей действительно пришёл. В одной строке лежит имя бота, адрес страницы, код ответа и число отданных байт, и этого скромного набора хватает, чтобы закрыть сразу четыре вопроса.

Доходят ли боты до страниц, которые приносят деньги, или ходят кругами по служебным адресам? Не сливают ли они бюджет обхода на мусор и не заблокированы ли где-то по дороге файрволом? И самый неудобный вопрос из всех, который обычно не задают вовсе: настоящие ли это боты вообще?

По каким именам фильтровать

Сначала стоит понять, что боты делают принципиально разные вещи и мерить их одной линейкой нельзя. Одни обходят сайт массово, чтобы собрать корпус текстов, а другие забирают одну страницу прямо в тот момент, когда человек задал вопрос в чате.

User-agentОператорЧто делает
GPTBotOpenAIМассовый обход для обучения и данных
OAI-SearchBotOpenAIСтроит поисковый индекс ChatGPT
ChatGPT-UserOpenAIДозапрос по требованию — человек спросил
ClaudeBotAnthropicМассовый обход для Claude
Claude-UserAnthropicДозапрос внутри чата Claude
PerplexityBotPerplexityИндексация для ответов Perplexity
Googlebot + Google-ExtendedGoogleОбход, регулируемый токеном Extended

Разница между этими двумя типами важнее, чем кажется на первый взгляд, и вот почему. Всплеск ChatGPT-User или Claude-User на одном адресе — это живой сигнал: кто-то прямо сейчас спрашивает про эту тему, и движок забирает твою страницу, чтобы ответить. Такой сигнал ценнее сырого объёма массового обхода в десять раз.

Что говорит одна строка

В строке лога четыре поля, которые имеют значение для видимости в ИИ.

Путь. Какой именно адрес забрали в этот раз; сгруппируй пути между собой — и получишь реальный охват.

Код ответа. Двести означает «отдано», триста четыре — «не изменилось», четыреста три — блокировку, четыреста четыре — отсутствие страницы, пятисотые — поломку. Бот, который получает только 403, не видит тебя вовсе, сколько бы раз он ни приходил.

Байты. Вот здесь прячется самая тихая из всех бед. Ответ с кодом 200, вернувший восемьсот байт на статью в четыре тысячи слов, означает, что бот получил каркас страницы, а не текст, — и формально всё зелёное!

Частота и время. Как часто бот возвращается и совпадает ли его темп с темпом твоих публикаций.

Четыре дыры, которые ищем

Первая — пробелы в охвате. Сгруппируй успешные запросы по адресу и сравни список с картой сайта: страницы, которые боты никогда не запрашивали, невидимы в ИИ-ответах, какими бы хорошими они ни были. Обычные жертвы — глубокие страницы со слабой перелинковкой, и это проблема структуры, а не текста.

Вторая — слитый обход. Посчитай запросы, попавшие на редиректы, несуществующие страницы, адреса фильтров и бесконечную пагинацию. Каждый такой запрос — это бюджет, не потраченный на реальную страницу, и на крупном сайте именно здесь прячется большая часть всех потерь.

Третья — блокировки и тощие ответы. Код 403 означает, что кто-то разворачивает ботов: правило файрвола, ограничитель частоты или сам robots.txt, а малое число байт на больших страницах означает, что бот забрал разметку, которая рендерится пустой. Большинство ИИ-краулеров не выполняют JavaScript, поэтому клиентское приложение читается в логах как пустая страница.

Четвёртая — проверка подлинности. О ней ниже, и она важнее всех предыдущих.

Проверь, что бот настоящий

Имя в строке user-agent сообщает сам клиент, и подделать его тривиально: скраперы регулярно надевают имя GPTBot, чтобы пройти мимо блокировок, и в отчёте они выглядят как настоящий трафик от OpenAI. Красиво, солидно и полностью мимо!

Прежде чем делать хоть один вывод, обязательно подтверди исходный адрес запроса. OpenAI, Anthropic и Google публикуют диапазоны своих краулеров машиночитаемыми списками, и сверяться надо в первую очередь именно с ними.

Запасной вариант на случай, когда списка под рукой нет, — обратный резолвинг с подтверждением: резолвим адрес обратно, проверяем, что он ведёт на домен оператора, потом резолвим полученное имя вперёд и убеждаемся, что получили тот же адрес.

Пропустишь этот шаг — и красивый отчёт «охват GPTBot вырос вдвое» будет считать чужой скрапер, а решения по нему ты примешь настоящие!

Чек-лист

  • Логи отфильтрованы по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
  • Каждый бот проверен по исходному адресу — по спискам диапазонов или обратным резолвингом.
  • Пути с кодом 200 сверены с картой сайта, необойдённые страницы выписаны.
  • Посчитан слитый обход: цепочки редиректов, 404, адреса фильтров, пагинация.
  • Отмечены блокировки и тощие ответы — мало байт на больших страницах.
  • Проверено, что частота переобхода совпадает с темпом публикаций.
  • Дозапросы по требованию выделены отдельно как сигнал живого интереса.
Куда уходит бюджет обхода ИИ-ботов на неотаудированном крупном сайте (иллюстративно)
Контентные страницы (200) 45%
Редиректы / 404 / фильтры 40%
Ассеты и прочее 15%

источник: внутренние аудиты, 2026

Эта раскладка и есть главный вывод статьи (цифры иллюстративные, но форма, кажется, знакома каждому, кто хоть раз открывал логи крупного сайта). Когда почти половина обхода уходит на редиректы и тупики, лечится это не новым контентом, а чисткой путей, что, согласись, довольно обидно для тех, кто ставил на тексты. Мой инструмент анализа логов делает такой проход автоматически: разбирает файл, проверяет каждого бота по адресу и возвращает два списка — пробелы в охвате и слитый бюджет.

С чего начать, если логов ты никогда не открывал

Порядок такой. Возьми лог за неделю, а не за день, потому что массовые обходы приходят волнами и день, скорее всего, ничего не покажет.

Отфильтруй строки по семи именам из таблицы выше и посмотри, сколько их всего. Если ноль — это уже результат, и он объясняет отсутствие цитирований лучше любого аудита текста.

Дальше сверь исходные адреса с опубликованными диапазонами операторов. Обычно на этом шаге отваливается заметная часть строк, и картина сразу становится честнее (а иногда и грустнее, но лучше грустная правда, чем весёлый скрапер).

И только после этого смотри на коды ответа и число байт. Порядок здесь важен: анализ непроверенных данных даёт уверенные, но неверные выводы, а это худшее сочетание из возможных.

Что делать с находками

Допустим, картина собралась. Что дальше — и в каком порядке чинить, если найденного набралось на месяц работы?

Первым делом закрывай блокировки, потому что бот, получающий 403, не приносит тебе ничего вообще, а исправляется это обычно одним правилом в файрволе. Вторым — тощие ответы: если боты забирают пустую разметку, то весь остальной анализ не имеет смысла, ведь читать им попросту нечего.

Третьим номером идёт слитый бюджет, и это самая скучная, но самая доходная часть работы: цепочки редиректов схлопываются в один переход, адреса фильтров закрываются от обхода, а битые ссылки просто чинятся. После такой уборки боты начинают доходить туда, куда раньше не добирались, без единой новой строчки текста — и это, наверное, самое приятное открытие во всей теме!

И только в последнюю очередь берись за пробелы охвата, потому что часть из них закроется сама собой после первых трёх шагов.

Коротко

  • Логи сервера — единственное доказательство того, что ИИ-краулеры реально забирают страницы; всё остальное лишь намерение.
  • Фильтруй по семи именам, а дозапросы по требованию читай как сигнал живого интереса.
  • Смотри путь, код, байты и частоту — этого хватает, чтобы найти пробелы охвата, слитый бюджет и пустые ответы.
  • Google-Extended в логах не появляется: это токен, а запрос делает Googlebot.
  • Проверяй каждого бота по адресу до всяких выводов, потому что имя подделывается тривиально.

На этом у меня всё. Иди открой свой лог — спорим, там тоже что-то найдётся?

Источники

Частые вопросы

Какие user-agent AI-краулеров искать в логах?

Ключевые в 2026 году — GPTBot и OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) и Googlebot, поведение которого регулирует robots-токен Google-Extended. ChatGPT-User и Claude-User — это дозапросы по требованию, которые срабатывают, когда человек задаёт вопрос: они сигнализируют о живом интересе, а не о массовом обходе.

Как убедиться, что строка в логе — это настоящий GPTBot, а не подделка?

Никогда не доверяй одной лишь строке user-agent — подделать её тривиально. OpenAI, Anthropic и Google публикуют диапазоны IP, с которых ходят их краулеры. Прежде чем засчитать запрос как настоящего бота, проверь, что его IP попадает в официальный опубликованный диапазон (или проходит forward-confirmed reverse DNS).

Рендерят ли AI-краулеры JavaScript, как Googlebot?

В основном нет. Большинство обучающих и ответных AI-краулеров забирают сырой HTML и не выполняют клиентский JavaScript, поэтому страница, которая отрисовывается только в браузере, для них часто пустая. Логи это показывают: HTML забран, но JSON или бандл гидрации, нужные браузеру, — никогда.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

  • …

Комментарии модерируются.