Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot
Коротко: ваши серверные access-логи — единственная объективная правда о том, что AI-краулеры реально делают на сайте. Всё остальное — robots.txt, sitemap, «я добавил llms.txt» — это лишь намерение. Строка лога — доказательство: в ней есть имя бота, URL, код ответа и число байт. Отфильтруйте эти строки по GPTBot, ClaudeBot, PerplexityBot и компании — и четыре вопроса ответят на себя сами: доходят ли боты до денежных страниц, не сливают ли бюджет на мусор, не заблокированы ли они и настоящие ли это запросы вообще.
По каким user-agent фильтровать
Не все AI-боты делают одно и то же. Одни обходят сайт массово, чтобы собрать корпус; другие забирают одну страницу в момент, когда пользователь задаёт вопрос. Правильное чтение логов начинается с понимания, кто есть кто.
| User-agent | Оператор | Что делает |
|---|---|---|
GPTBot | OpenAI | Массовый обход для обучения/данных |
OAI-SearchBot | OpenAI | Строит поисковый индекс ChatGPT |
ChatGPT-User | OpenAI | Дозапрос по требованию — пользователь спросил |
ClaudeBot | Anthropic | Массовый обход для Claude |
Claude-User | Anthropic | Дозапрос внутри чата Claude |
PerplexityBot | Perplexity | Индексация для ответов Perplexity |
Googlebot + Google-Extended | Обход, регулируемый токеном Extended (см. ниже) |
Всплеск ChatGPT-User или Claude-User на одном URL — живой сигнал: кто-то спрашивает AI об этой теме, и он забирает вашу страницу, чтобы ответить. Это ценнее, чем сырой объём массового обхода.
Что говорит одна строка лога
Единственная строка access-лога несёт четыре поля, важных для GEO:
- Путь — какой URL забрали. Сгруппируйте их — получите охват.
- Код — 200 (отдано), 304 (не изменилось), 403 (блок), 404 (нет), 5xx (сломано). Бот, который получает только 403, вас не видит никогда.
- Байты — 200, вернувший 800 байт на статью в 4000 слов, означает, что бот получил каркас, а не контент.
- Частота + время — как часто и совпадает ли переобход с вашим темпом публикаций.
Четыре пробела, за которыми охотимся
1. Пробелы в охвате. Сгруппируйте успешные (200) запросы по пути и сравните с sitemap. Страницы, которые боты никогда не запрашивают, невидимы для AI-ответов, какими бы хорошими они ни были. Обычные жертвы — глубокие, плохо перелинкованные страницы: это проблема краул-бюджета и внутренней перелинковки, а не контента.
2. Слитый краул. Посчитайте запросы, попавшие на редиректы (цепочки 301/302), 404, URL фасетных фильтров или бесконечную пагинацию. Каждый из них — бюджет, который бот не потратил на реальную страницу. На крупном сайте именно здесь прячется большая часть слитого AI-краула.
3. Блокировки и тощие ответы. 403 означает, что что-то — правило WAF, рейт-лимитер или robots.txt — разворачивает ботов. Малое число байт на больших страницах означает, что бот забрал HTML, который рендерится пустым. Так как большинство AI-краулеров не выполняют JavaScript, клиентский SPA читается в логах как пустая страница.
4. Проверка. Убедитесь, что запросы настоящие, прежде чем доверять всему вышесказанному.
Проверьте, что бот настоящий
Строка user-agent сообщается самим клиентом, и подделать её тривиально — скраперы регулярно маскируются под GPTBot, чтобы обойти блокировки. Прежде чем делать хоть один вывод, подтвердите исходный IP:
- OpenAI, Anthropic и Google публикуют диапазоны IP своих краулеров машиночитаемыми списками, с которыми можно сверяться.
- Forward-confirmed reverse DNS — запасной вариант: обратно резолвим IP, проверяем, что он ведёт на домен оператора, затем прямо резолвим этот хостнейм обратно к тому же IP.
Пропустите это — и ваш отчёт «охват GPTBot» может считать скрапер, надевший имя GPTBot.
Чек-лист
- Логи отфильтрованы по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
- Каждый бот проверен по исходному IP (опубликованные диапазоны или forward-confirmed rDNS).
- Пути с кодом 200 сверены с sitemap — выписаны никогда не обойдённые страницы.
- Посчитан слитый краул: цепочки редиректов, 404, фасетные URL, пагинация.
- Отмечены 403 и тощие ответы (мало байт на больших страницах).
- Проверено, что частота переобхода совпадает с темпом публикаций.
- Дозапросы по требованию (ChatGPT-User / Claude-User) выделены как сигнал живого интереса.
источник: внутренние аудиты, 2026
Раскладка и есть суть: когда почти половина обхода уходит на редиректы и тупики, лекарство — не больше контента, а чистка путей, на которые боты сливают бюджет. Наш инструмент анализа логов AI-краулеров делает этот проход за вас: парсит логи, проверяет каждого бота и возвращает списки пробелов в охвате и слитого краула.
Коротко
- Серверные логи — единственное доказательство того, что AI-краулеры реально забирают; остальное лишь намерение.
- Фильтруйте по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot и Googlebot; дозапросы трактуйте как живой интерес.
- Читайте путь, код, байты и частоту, чтобы найти пробелы в охвате, слитый краул и блокированные или тощие страницы.
- Google-Extended — robots-токен, а не строка лога: запрос по-прежнему делает Googlebot.
- Проверяйте каждого бота по IP, прежде чем доверять цифрам; user-agent подделывается тривиально.
Источники
- OpenAI, доки «GPTBot» и «OAI-SearchBot» — platform.openai.com/docs/bots: официальные user-agent и опубликованные диапазоны IP краулеров.
- Google Search Central, «Overview of Google crawlers and fetchers» — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers: подтверждает, что Google-Extended — robots-токен для Googlebot, а не отдельный краулер.
- RFC 9309, «Robots Exclusion Protocol» — rfc-editor.org/rfc/rfc9309: стандарт, определяющий трактовку токенов user-agent и директив.
- Связанное: почему SPA невидимы для AI-краулеров и управление AI-ботами в robots.txt.
Частые вопросы
Какие user-agent AI-краулеров искать в логах?
Ключевые в 2026 году — GPTBot и OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) и Googlebot, поведение которого регулирует robots-токен Google-Extended. ChatGPT-User и Claude-User — это дозапросы по требованию, которые срабатывают, когда человек задаёт вопрос: они сигнализируют о живом интересе, а не о массовом обходе.
Как убедиться, что строка в логе — это настоящий GPTBot, а не подделка?
Никогда не доверяйте одной лишь строке user-agent — подделать её тривиально. OpenAI, Anthropic и Google публикуют диапазоны IP, с которых ходят их краулеры. Прежде чем засчитать запрос как настоящего бота, проверьте, что его IP попадает в официальный опубликованный диапазон (или проходит forward-confirmed reverse DNS).
Рендерят ли AI-краулеры JavaScript, как Googlebot?
В основном нет. Большинство обучающих и ответных AI-краулеров забирают сырой HTML и не выполняют клиентский JavaScript, поэтому страница, которая отрисовывается только в браузере, для них часто пустая. Логи это показывают: HTML забран, но JSON или бандл гидрации, нужные браузеру, — никогда.
Новые статьи — на почту
Разборы GEO/SEO от автономной команды. Без спама — отписка в любой момент.
Комментарии