seo·matrix
← Все статьи

Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot

· 5 мин чтения · Автор Михаил Кузьмицкий

GEOAI-краулерыанализ логовтехнический SEO

Markdown-версия ↗

Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot

Коротко: ваши серверные access-логи — единственная объективная правда о том, что AI-краулеры реально делают на сайте. Всё остальное — robots.txt, sitemap, «я добавил llms.txt» — это лишь намерение. Строка лога — доказательство: в ней есть имя бота, URL, код ответа и число байт. Отфильтруйте эти строки по GPTBot, ClaudeBot, PerplexityBot и компании — и четыре вопроса ответят на себя сами: доходят ли боты до денежных страниц, не сливают ли бюджет на мусор, не заблокированы ли они и настоящие ли это запросы вообще.

По каким user-agent фильтровать

Не все AI-боты делают одно и то же. Одни обходят сайт массово, чтобы собрать корпус; другие забирают одну страницу в момент, когда пользователь задаёт вопрос. Правильное чтение логов начинается с понимания, кто есть кто.

User-agentОператорЧто делает
GPTBotOpenAIМассовый обход для обучения/данных
OAI-SearchBotOpenAIСтроит поисковый индекс ChatGPT
ChatGPT-UserOpenAIДозапрос по требованию — пользователь спросил
ClaudeBotAnthropicМассовый обход для Claude
Claude-UserAnthropicДозапрос внутри чата Claude
PerplexityBotPerplexityИндексация для ответов Perplexity
Googlebot + Google-ExtendedGoogleОбход, регулируемый токеном Extended (см. ниже)

Всплеск ChatGPT-User или Claude-User на одном URL — живой сигнал: кто-то спрашивает AI об этой теме, и он забирает вашу страницу, чтобы ответить. Это ценнее, чем сырой объём массового обхода.

Что говорит одна строка лога

Единственная строка access-лога несёт четыре поля, важных для GEO:

  • Путь — какой URL забрали. Сгруппируйте их — получите охват.
  • Код — 200 (отдано), 304 (не изменилось), 403 (блок), 404 (нет), 5xx (сломано). Бот, который получает только 403, вас не видит никогда.
  • Байты — 200, вернувший 800 байт на статью в 4000 слов, означает, что бот получил каркас, а не контент.
  • Частота + время — как часто и совпадает ли переобход с вашим темпом публикаций.

Четыре пробела, за которыми охотимся

1. Пробелы в охвате. Сгруппируйте успешные (200) запросы по пути и сравните с sitemap. Страницы, которые боты никогда не запрашивают, невидимы для AI-ответов, какими бы хорошими они ни были. Обычные жертвы — глубокие, плохо перелинкованные страницы: это проблема краул-бюджета и внутренней перелинковки, а не контента.

2. Слитый краул. Посчитайте запросы, попавшие на редиректы (цепочки 301/302), 404, URL фасетных фильтров или бесконечную пагинацию. Каждый из них — бюджет, который бот не потратил на реальную страницу. На крупном сайте именно здесь прячется большая часть слитого AI-краула.

3. Блокировки и тощие ответы. 403 означает, что что-то — правило WAF, рейт-лимитер или robots.txt — разворачивает ботов. Малое число байт на больших страницах означает, что бот забрал HTML, который рендерится пустым. Так как большинство AI-краулеров не выполняют JavaScript, клиентский SPA читается в логах как пустая страница.

4. Проверка. Убедитесь, что запросы настоящие, прежде чем доверять всему вышесказанному.

Проверьте, что бот настоящий

Строка user-agent сообщается самим клиентом, и подделать её тривиально — скраперы регулярно маскируются под GPTBot, чтобы обойти блокировки. Прежде чем делать хоть один вывод, подтвердите исходный IP:

  • OpenAI, Anthropic и Google публикуют диапазоны IP своих краулеров машиночитаемыми списками, с которыми можно сверяться.
  • Forward-confirmed reverse DNS — запасной вариант: обратно резолвим IP, проверяем, что он ведёт на домен оператора, затем прямо резолвим этот хостнейм обратно к тому же IP.

Пропустите это — и ваш отчёт «охват GPTBot» может считать скрапер, надевший имя GPTBot.

Чек-лист

  • Логи отфильтрованы по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
  • Каждый бот проверен по исходному IP (опубликованные диапазоны или forward-confirmed rDNS).
  • Пути с кодом 200 сверены с sitemap — выписаны никогда не обойдённые страницы.
  • Посчитан слитый краул: цепочки редиректов, 404, фасетные URL, пагинация.
  • Отмечены 403 и тощие ответы (мало байт на больших страницах).
  • Проверено, что частота переобхода совпадает с темпом публикаций.
  • Дозапросы по требованию (ChatGPT-User / Claude-User) выделены как сигнал живого интереса.
Куда уходит краул-бюджет AI-ботов на неотаудированном крупном сайте (иллюстративно)
Контентные страницы (200) 45%
Редиректы / 404 / фасеты 40%
Ассеты и прочее 15%

источник: внутренние аудиты, 2026

Раскладка и есть суть: когда почти половина обхода уходит на редиректы и тупики, лекарство — не больше контента, а чистка путей, на которые боты сливают бюджет. Наш инструмент анализа логов AI-краулеров делает этот проход за вас: парсит логи, проверяет каждого бота и возвращает списки пробелов в охвате и слитого краула.

Коротко

  • Серверные логи — единственное доказательство того, что AI-краулеры реально забирают; остальное лишь намерение.
  • Фильтруйте по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot и Googlebot; дозапросы трактуйте как живой интерес.
  • Читайте путь, код, байты и частоту, чтобы найти пробелы в охвате, слитый краул и блокированные или тощие страницы.
  • Google-Extended — robots-токен, а не строка лога: запрос по-прежнему делает Googlebot.
  • Проверяйте каждого бота по IP, прежде чем доверять цифрам; user-agent подделывается тривиально.

Источники

Частые вопросы

Какие user-agent AI-краулеров искать в логах?

Ключевые в 2026 году — GPTBot и OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) и Googlebot, поведение которого регулирует robots-токен Google-Extended. ChatGPT-User и Claude-User — это дозапросы по требованию, которые срабатывают, когда человек задаёт вопрос: они сигнализируют о живом интересе, а не о массовом обходе.

Как убедиться, что строка в логе — это настоящий GPTBot, а не подделка?

Никогда не доверяйте одной лишь строке user-agent — подделать её тривиально. OpenAI, Anthropic и Google публикуют диапазоны IP, с которых ходят их краулеры. Прежде чем засчитать запрос как настоящего бота, проверьте, что его IP попадает в официальный опубликованный диапазон (или проходит forward-confirmed reverse DNS).

Рендерят ли AI-краулеры JavaScript, как Googlebot?

В основном нет. Большинство обучающих и ответных AI-краулеров забирают сырой HTML и не выполняют клиентский JavaScript, поэтому страница, которая отрисовывается только в браузере, для них часто пустая. Логи это показывают: HTML забран, но JSON или бандл гидрации, нужные браузеру, — никогда.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

Комментарии модерируются.