# Анализ логов AI-краулеров: что на самом деле забирают GPTBot и ClaudeBot

> Читаем серверные логи по GPTBot, ClaudeBot и PerplexityBot: пробелы в охвате, слитый краул-бюджет, блокировки и проверка, что боты доходят до контента.

_Source: https://seomatrix.ai/ru/blog/ai-crawler-logs/ · Updated: 2026-07-23_

---

Коротко: ваши **серверные access-логи** — единственная объективная правда о том, что AI-краулеры реально делают на сайте. Всё остальное — robots.txt, sitemap, «я добавил llms.txt» — это лишь намерение. Строка лога — доказательство: в ней есть имя бота, URL, код ответа и число байт. Отфильтруйте эти строки по GPTBot, ClaudeBot, PerplexityBot и компании — и четыре вопроса ответят на себя сами: доходят ли боты до денежных страниц, не сливают ли бюджет на мусор, не заблокированы ли они и настоящие ли это запросы вообще.

## По каким user-agent фильтровать

Не все AI-боты делают одно и то же. Одни обходят сайт массово, чтобы собрать корпус; другие забирают одну страницу в момент, когда пользователь задаёт вопрос. Правильное чтение логов начинается с понимания, кто есть кто.

| User-agent | Оператор | Что делает |
|---|---|---|
| `GPTBot` | OpenAI | Массовый обход для обучения/данных |
| `OAI-SearchBot` | OpenAI | Строит поисковый индекс ChatGPT |
| `ChatGPT-User` | OpenAI | Дозапрос по требованию — пользователь спросил |
| `ClaudeBot` | Anthropic | Массовый обход для Claude |
| `Claude-User` | Anthropic | Дозапрос внутри чата Claude |
| `PerplexityBot` | Perplexity | Индексация для ответов Perplexity |
| `Googlebot` + `Google-Extended` | Google | Обход, регулируемый токеном Extended (см. ниже) |

Всплеск `ChatGPT-User` или `Claude-User` на одном URL — живой сигнал: кто-то спрашивает AI об этой теме, и он забирает вашу страницу, чтобы ответить. Это ценнее, чем сырой объём массового обхода.

## Что говорит одна строка лога

Единственная строка access-лога несёт четыре поля, важных для GEO:

- **Путь** — какой URL забрали. Сгруппируйте их — получите охват.
- **Код** — 200 (отдано), 304 (не изменилось), 403 (блок), 404 (нет), 5xx (сломано). Бот, который получает только 403, вас не видит никогда.
- **Байты** — 200, вернувший 800 байт на статью в 4000 слов, означает, что бот получил каркас, а не контент.
- **Частота + время** — как часто и совпадает ли переобход с вашим темпом публикаций.

## Четыре пробела, за которыми охотимся

**1. Пробелы в охвате.** Сгруппируйте успешные (200) запросы по пути и сравните с sitemap. Страницы, которые боты никогда не запрашивают, невидимы для AI-ответов, какими бы хорошими они ни были. Обычные жертвы — глубокие, плохо перелинкованные страницы: это проблема краул-бюджета и внутренней перелинковки, а не контента.

**2. Слитый краул.** Посчитайте запросы, попавшие на редиректы (цепочки 301/302), 404, URL фасетных фильтров или бесконечную пагинацию. Каждый из них — бюджет, который бот не потратил на реальную страницу. На крупном сайте именно здесь прячется большая часть слитого AI-краула.

**3. Блокировки и тощие ответы.** 403 означает, что что-то — правило WAF, рейт-лимитер или robots.txt — разворачивает ботов. Малое число байт на больших страницах означает, что бот забрал HTML, который рендерится пустым. Так как большинство AI-краулеров не выполняют JavaScript, клиентский SPA читается в логах как пустая страница.

**4. Проверка.** Убедитесь, что запросы настоящие, прежде чем доверять всему вышесказанному.

> **Google-Extended — это токен, а не краулер** — Строки `Google-Extended` в логах вы не найдёте. Google-Extended — управляющий токен robots.txt, который определяет, можно ли использовать уже забранный Googlebot контент для Gemini и Vertex AI; сам запрос по-прежнему делает обычный `Googlebot`. Поэтому блокировка Google-Extended не снижает трафик обхода — она меняет лишь разрешение. Логи читайте по `Googlebot`, а решение об AI-использовании ведите отдельно в robots.txt.

## Проверьте, что бот настоящий

Строка user-agent сообщается самим клиентом, и подделать её тривиально — скраперы регулярно маскируются под GPTBot, чтобы обойти блокировки. Прежде чем делать хоть один вывод, подтвердите исходный IP:

- **OpenAI, Anthropic и Google публикуют диапазоны IP** своих краулеров машиночитаемыми списками, с которыми можно сверяться.
- **Forward-confirmed reverse DNS** — запасной вариант: обратно резолвим IP, проверяем, что он ведёт на домен оператора, затем прямо резолвим этот хостнейм обратно к тому же IP.

Пропустите это — и ваш отчёт «охват GPTBot» может считать скрапер, надевший имя GPTBot.

> **Не действуйте по непроверенным логам** — Непроверенный счётчик user-agent хуже, чем отсутствие данных: он выглядит авторитетно и при этом ошибочен. Жалоба «нас блокируют», паника «нас переобходят» и правка пробела в охвате — всё это можно проследить до подделки, если пропустить проверку IP. Сначала проверка, потом решение.

## Чек-лист

- [ ] Логи отфильтрованы по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Googlebot.
- [ ] Каждый бот проверен по исходному IP (опубликованные диапазоны или forward-confirmed rDNS).
- [ ] Пути с кодом 200 сверены с sitemap — выписаны никогда не обойдённые страницы.
- [ ] Посчитан слитый краул: цепочки редиректов, 404, фасетные URL, пагинация.
- [ ] Отмечены 403 и тощие ответы (мало байт на больших страницах).
- [ ] Проверено, что частота переобхода совпадает с темпом публикаций.
- [ ] Дозапросы по требованию (ChatGPT-User / Claude-User) выделены как сигнал живого интереса.

Раскладка и есть суть: когда почти половина обхода уходит на редиректы и тупики, лекарство — не больше контента, а чистка путей, на которые боты сливают бюджет. Наш [инструмент анализа логов AI-краулеров](/ru/tools/ai-crawler-log) делает этот проход за вас: парсит логи, проверяет каждого бота и возвращает списки пробелов в охвате и слитого краула.

## Коротко

- Серверные логи — единственное доказательство того, что AI-краулеры реально забирают; остальное лишь намерение.
- Фильтруйте по GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot и Googlebot; дозапросы трактуйте как живой интерес.
- Читайте путь, код, байты и частоту, чтобы найти пробелы в охвате, слитый краул и блокированные или тощие страницы.
- Google-Extended — robots-токен, а не строка лога: запрос по-прежнему делает Googlebot.
- Проверяйте каждого бота по IP, прежде чем доверять цифрам; user-agent подделывается тривиально.

## Источники

- **OpenAI, доки «GPTBot» и «OAI-SearchBot»** — [platform.openai.com/docs/bots](https://platform.openai.com/docs/bots): официальные user-agent и опубликованные диапазоны IP краулеров.
- **Google Search Central, «Overview of Google crawlers and fetchers»** — [developers.google.com/search/docs/crawling-indexing/overview-google-crawlers](https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers): подтверждает, что Google-Extended — robots-токен для Googlebot, а не отдельный краулер.
- **RFC 9309, «Robots Exclusion Protocol»** — [rfc-editor.org/rfc/rfc9309](https://www.rfc-editor.org/rfc/rfc9309): стандарт, определяющий трактовку токенов user-agent и директив.
- Связанное: [почему SPA невидимы для AI-краулеров](/ru/blog/geo-for-spa/) и [управление AI-ботами в robots.txt](/ru/blog/ai-bots-robots/).

## FAQ

### Какие user-agent AI-краулеров искать в логах?

Ключевые в 2026 году — GPTBot и OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) и Googlebot, поведение которого регулирует robots-токен Google-Extended. ChatGPT-User и Claude-User — это дозапросы по требованию, которые срабатывают, когда человек задаёт вопрос: они сигнализируют о живом интересе, а не о массовом обходе.

### Как убедиться, что строка в логе — это настоящий GPTBot, а не подделка?

Никогда не доверяйте одной лишь строке user-agent — подделать её тривиально. OpenAI, Anthropic и Google публикуют диапазоны IP, с которых ходят их краулеры. Прежде чем засчитать запрос как настоящего бота, проверьте, что его IP попадает в официальный опубликованный диапазон (или проходит forward-confirmed reverse DNS).

### Рендерят ли AI-краулеры JavaScript, как Googlebot?

В основном нет. Большинство обучающих и ответных AI-краулеров забирают сырой HTML и не выполняют клиентский JavaScript, поэтому страница, которая отрисовывается только в браузере, для них часто пустая. Логи это показывают: HTML забран, но JSON или бандл гидрации, нужные браузеру, — никогда.

