# Валидатор robots.txt

_Источник: https://seomatrix.ai/ru/tools/robots-validator/_

---

## Что делает

Валидатор robots.txt проверяет текстовый файл в корне домена, который сообщает краулерам, какие разделы сайта им разрешено обходить, и подсвечивает опасные правила — например случайную блокировку всего сайта — и устаревшие, которые поисковые и AI-движки уже не учитывают. ChatGPT, Perplexity и краулеры Google читают robots.txt перед обращением к странице, поэтому одна забытая строка `Disallow: /` способна сделать весь сайт невидимым для движков, которые иначе процитировали бы вас. Проверка ловит такие ошибки и отсутствующие сигналы — например строку Sitemap — до того, как они стоят вам обхода и цитирований.

## Что проверяет

- **Блокировка всего сайта (Disallow: /)** — `Disallow: /` под `User-agent: *` закрывает от краулеров весь сайт — самая разрушительная строка, часто попадающая в продакшн из staging-конфига по ошибке.
- **Отсутствие директивы Sitemap** — Строка `Sitemap:` ведёт краулеров прямо к списку ваших URL; она необязательна, но рекомендуется, а её отсутствие заставляет движки искать страницы медленным способом.
- **Синтаксис и опечатки** — Опечатки в полях (например, `Dissalow`) и некорректные строки просто игнорируются, поэтому правило, которое вы считаете рабочим, может не существовать вовсе.
- **Директива Crawl-delay** — `Crawl-delay` игнорируется Google и большинством AI-краулеров — его учитывают лишь некоторые движки, — так что расчёт на него для ограничения ботов создаёт ложное чувство контроля.
- **Устаревшие директивы** — Директивы вроде `Noindex` или `Nofollow` внутри robots.txt не поддерживаются; они не действуют, и их место — в мета-тегах или HTTP-заголовках.

## Как пользоваться

1. Вставьте содержимое robots.txt или укажите URL сайта, чтобы загрузить живой файл.
2. Просмотрите отмеченные правила — блокировку всего сайта, синтаксические ошибки, устаревшие или неподдерживаемые директивы и отсутствие строки Sitemap.
3. Исправьте опасные правила в robots.txt, выложите файл по адресу /robots.txt и запустите проверку повторно, чтобы убедиться, что он чист.

## Вопросы

### Какая ошибка в robots.txt самая опасная?

Случайный `Disallow: /` под `User-agent: *` — он закрывает от краулеров весь сайт, и ничего не индексируется и не цитируется. Обычно это staging-правило, по ошибке попавшее в продакшн.

### Блокирует ли robots.txt AI-краулеры вроде GPTBot и PerplexityBot?

Да. AI-краулеры первым делом читают robots.txt, поэтому блокировка всего сайта или конкретного бота лишает ChatGPT, Perplexity и подобные движки возможности прочитать и процитировать ваши страницы.

### Учитывается ли ещё Crawl-delay?

Google и большинство AI-краулеров игнорируют `Crawl-delay`; его по-прежнему соблюдают лишь некоторые движки, например Bing (Yandex отказался от директивы в пользу настройки скорости обхода в Yandex.Webmaster). Валидатор помечает её, чтобы вы не полагались на директиву, которая не работает там, где это важнее всего.

### Можно ли скрыть страницу от Google через robots.txt?

Нет — robots.txt управляет обходом, а не индексацией. Закрытый URL всё равно может появиться в выдаче без сниппета; чтобы убрать страницу из индекса, используйте мета-тег `noindex`.

