seo·matrix
бесплатный инструмент

Валидатор robots.txt

Сломанный robots.txt может тихо выкинуть весь сайт из индекса. Вставьте robots.txt или подтяните по URL — мы проверим опасное и устаревшее. (Про ИИ-ботов — чекер доступа.)

    Что проверяет этот инструмент

    Валидатор robots.txt проверяет текстовый файл в корне домена, который сообщает краулерам, какие разделы сайта им разрешено обходить, и подсвечивает опасные правила — например случайную блокировку всего сайта — и устаревшие, которые поисковые и AI-движки уже не учитывают. ChatGPT, Perplexity и краулеры Google читают robots.txt перед обращением к странице, поэтому одна забытая строка `Disallow: /` способна сделать весь сайт невидимым для движков, которые иначе процитировали бы вас. Проверка ловит такие ошибки и отсутствующие сигналы — например строку Sitemap — до того, как они стоят вам обхода и цитирований.

    Что учитывается

    Блокировка всего сайта (Disallow: /)
    `Disallow: /` под `User-agent: *` закрывает от краулеров весь сайт — самая разрушительная строка, часто попадающая в продакшн из staging-конфига по ошибке.
    Отсутствие директивы Sitemap
    Строка `Sitemap:` ведёт краулеров прямо к списку ваших URL; она необязательна, но рекомендуется, а её отсутствие заставляет движки искать страницы медленным способом.
    Синтаксис и опечатки
    Опечатки в полях (например, `Dissalow`) и некорректные строки просто игнорируются, поэтому правило, которое вы считаете рабочим, может не существовать вовсе.
    Директива Crawl-delay
    `Crawl-delay` игнорируется Google и большинством AI-краулеров — его учитывают лишь некоторые движки, — так что расчёт на него для ограничения ботов создаёт ложное чувство контроля.
    Устаревшие директивы
    Директивы вроде `Noindex` или `Nofollow` внутри robots.txt не поддерживаются; они не действуют, и их место — в мета-тегах или HTTP-заголовках.

    Как пользоваться

    1. Вставьте содержимое robots.txt или укажите URL сайта, чтобы загрузить живой файл.
    2. Просмотрите отмеченные правила — блокировку всего сайта, синтаксические ошибки, устаревшие или неподдерживаемые директивы и отсутствие строки Sitemap.
    3. Исправьте опасные правила в robots.txt, выложите файл по адресу /robots.txt и запустите проверку повторно, чтобы убедиться, что он чист.

    Частые вопросы

    Какая ошибка в robots.txt самая опасная?

    Случайный `Disallow: /` под `User-agent: *` — он закрывает от краулеров весь сайт, и ничего не индексируется и не цитируется. Обычно это staging-правило, по ошибке попавшее в продакшн.

    Блокирует ли robots.txt AI-краулеры вроде GPTBot и PerplexityBot?

    Да. AI-краулеры первым делом читают robots.txt, поэтому блокировка всего сайта или конкретного бота лишает ChatGPT, Perplexity и подобные движки возможности прочитать и процитировать ваши страницы.

    Учитывается ли ещё Crawl-delay?

    Google и большинство AI-краулеров игнорируют `Crawl-delay`; его по-прежнему соблюдают лишь некоторые движки, например Bing (Yandex отказался от директивы в пользу настройки скорости обхода в Yandex.Webmaster). Валидатор помечает её, чтобы вы не полагались на директиву, которая не работает там, где это важнее всего.

    Можно ли скрыть страницу от Google через robots.txt?

    Нет — robots.txt управляет обходом, а не индексацией. Закрытый URL всё равно может появиться в выдаче без сниппета; чтобы убрать страницу из индекса, используйте мета-тег `noindex`.

    поделиться результатом Полезный результат? Отправьте коллеге: Telegram WhatsApp X
    это лишь один инструмент

    Этот аудит — 1 из 85 операций seo·matrix

    Бесплатные тулзы показывают, ЧТО чинить. Полный аудит и автономная команда из 20 ИИ-агентов чинят это под ключ — стратегия, тексты, GEO, перелинковка, публикация и поддержка на «дне втором».

    Все бесплатные тулзы →