Сломанный robots.txt может тихо выкинуть весь сайт из индекса. Вставьте robots.txt или подтяните по URL — мы проверим опасное и устаревшее. (Про ИИ-ботов — чекер доступа.)
Валидатор robots.txt проверяет текстовый файл в корне домена, который сообщает краулерам, какие разделы сайта им разрешено обходить, и подсвечивает опасные правила — например случайную блокировку всего сайта — и устаревшие, которые поисковые и AI-движки уже не учитывают. ChatGPT, Perplexity и краулеры Google читают robots.txt перед обращением к странице, поэтому одна забытая строка `Disallow: /` способна сделать весь сайт невидимым для движков, которые иначе процитировали бы вас. Проверка ловит такие ошибки и отсутствующие сигналы — например строку Sitemap — до того, как они стоят вам обхода и цитирований.
Случайный `Disallow: /` под `User-agent: *` — он закрывает от краулеров весь сайт, и ничего не индексируется и не цитируется. Обычно это staging-правило, по ошибке попавшее в продакшн.
Да. AI-краулеры первым делом читают robots.txt, поэтому блокировка всего сайта или конкретного бота лишает ChatGPT, Perplexity и подобные движки возможности прочитать и процитировать ваши страницы.
Google и большинство AI-краулеров игнорируют `Crawl-delay`; его по-прежнему соблюдают лишь некоторые движки, например Bing (Yandex отказался от директивы в пользу настройки скорости обхода в Yandex.Webmaster). Валидатор помечает её, чтобы вы не полагались на директиву, которая не работает там, где это важнее всего.
Нет — robots.txt управляет обходом, а не индексацией. Закрытый URL всё равно может появиться в выдаче без сниппета; чтобы убрать страницу из индекса, используйте мета-тег `noindex`.
Бесплатные тулзы показывают, ЧТО чинить. Полный аудит и автономная команда из 20 ИИ-агентов чинят это под ключ — стратегия, тексты, GEO, перелинковка, публикация и поддержка на «дне втором».
Все бесплатные тулзы →cookies
Матрица и так всё про вас знает — куки на этом фоне мелочь. Но выбор, как всегда, за вами: