seo·matrix
← Все статьи

Пускает ли ваш robots.txt ИИ? Проверили 6 известных сайтов бесплатным чекером

· 7 мин чтения · Автор Михаил Кузьмицкий

Markdown-версия ↗

Коротко, для тех, кто не дочитает: вопрос номер ноль во всей истории с GEO — пускает ли сайт ИИ-ботов вообще. Ниже результаты проверки robots.txt шести крупных сайтов, разница между обучающими и цитирующими краулерами и одна невнимательная строка, которая вычёркивает сайт из ответов целиком.

Третьего июля от нечего делать открыл robots.txt The Verge — просто посмотреть, кого они пускают, а кого нет. И увидел файл, который читается как пресс-релиз о сделке: боты OpenAI допущены, все остальные цитирующие закрыты. Полез проверять остальные медиа, и через полчаса у меня была табличка, ради которой, собственно, и написан этот текст.

Но сначала тезис, к которому эта табличка подводит. У GEO есть вопрос, который идёт до капсул, разметки и файлов для ИИ: может ли движок вообще прочитать сайт. Если ответ отрицательный, вся остальная работа не имеет значения, потому что читать её будет попросту некому.

Пускает ли ваш robots.txt ИИ? Проверили 6 известных сайтов бесплатным чекером

Что проверяет чекер

Вставляешь домен, чекер читает живой robots.txt и раскладывает 27 известных ИИ-ботов на три группы, ставя каждому вердикт: пускается или заблокирован. Никаких догадок, только то, что реально написано в файле, разобранное по тем же правилам, которые применяют сами боты.

Почему 27, а не один? Потому что «ИИ-бот» — это не одна программа: у каждого движка их несколько, и задачи у них разные. Закрыть все скопом — распространённое решение, и принимают его, кажется, чаще всего не глядя, что именно закрывается.

Проверили шесть известных сайтов

Я прогнал через чекер robots.txt шести крупных сайтов. Снимок сделан 3 июля 2026 года, «заблокирован» означает, что имя бота попадает под сплошной запрет.

СайтЦитирующих заблокировано (из 14)Обучающих (из 11)Что это значит
reddit.com1411закрыто всё, доступ только по контракту
nytimes.com99жёсткая лицензионная позиция
cnn.com1010то же самое
theverge.com109но OpenAI пущен: сделка видна прямо в файле
bbc.com69середина
medium.com06образец: обучение закрыто, цитирование открыто

Самая показательная строка — The Verge, та самая, с которой всё началось. Боты OpenAI допущены, остальные цитирующие закрыты, и лицензионное соглашение читается прямо из технического файла. Забавно, что robots.txt оказался самым честным источником информации о сделках медиахолдингов (пресс-релизы, кажется, врут чаще)!

Последняя строка — то, к чему стоит стремиться обычному сайту. Обучение закрыто, цитирование открыто, и это осмысленная позиция: не хочу кормить чужую модель бесплатно, но хочу, чтобы меня называли в ответах.

Цитирование и обучение — разные вещи

Медиагиганты блокируют цитирующих ботов осознанно: это рычаг в переговорах о лицензии, и у крупных изданий он действительно есть. Вопрос в другом — есть ли такой рычаг у обычного сайта, у которого нет ни юристов, ни миллионной аудитории?

Нет. Закрывая цитирующего бота, небольшой сайт не получает никакой переговорной позиции, он просто исчезает из ответов, и вместе с ним исчезает канал, по которому к нему приходили люди. Плата за принципиальность выходит односторонней, и платит её не медиахолдинг.

Как выглядит разумная настройка

Разумная позиция для сайта, который живёт с трафика, выглядит примерно так. Обучающие краулеры закрываются, если владелец не хочет отдавать тексты в тренировку, а цитирующие остаются открытыми, потому что именно через них сайт называют в ответах. Боты, которые ходят по прямой просьбе пользователя, тоже остаются: за ними стоит живой человек, попросивший открыть конкретную страницу, и отказывать ему, пожалуй, странно.

Проверять настройку стоит после каждого изменения robots.txt, и вот почему. Файл правят редко, обычно в спешке и часто не те люди, которые понимают последствия: типичная история — разработчик закрыл раздел от нагрузки, а под правило попала половина ботов, и никто этого не заметил.

На себе и как починить

Мой robots.txt отдаёт всем разрешение на обход, и все 27 строк в чекере зелёные. Результат скучный, и для продающей статьи он неудобен: гораздо эффектнее было бы рассказать, как я нашёл у себя катастрофу и героически её починил!

Но правда прозаичнее: я просто не трогал файл лишний раз. Большинство проблем с доступом возникает не от злого умысла, а от накопленных правок, каждая из которых по отдельности выглядела разумной, а вместе они дали сплошной запрет.

Если чекер показал закрытых цитирующих ботов, порядок такой. Открыть robots.txt, найти правило, под которое они попадают, и переписать его точечно: запрет обучающим по именам, разрешение остальным, после чего проверить ещё раз тем же чекером и убедиться, что стало зелёным. Вся правка занимает минут десять, а искать её без инструмента можно годами.

Что бывает, если закрыть всех

Расскажу, как это выглядит со стороны сайта, потому что теория тут скучная, а последствия наглядные. Сайт с закрытыми ботами живёт обычной жизнью: страницы открываются, поиск их индексирует, позиции держатся, ничего не ломается, и в этом главная подлость.

Меняется одно: сайт перестаёт появляться в ответах. Человек спрашивает у помощника про эту тему, помощник собирает ответ из трёх источников, и все три чужие! Проверить это можно только специально, потому что ни один отчёт по позициям такую пропажу не показывает.

Через полгода это видно уже по цифрам: показов в поиске столько же, кликов меньше. Обычно это списывают на общее падение рынка, и формально не ошибаются, падение есть у всех, просто у сайта с закрытыми ботами оно вдвое глубже, а причина лежит в файле, который правили год назад.

Как понять, что случай именно такой? Открой отчёт за год и посмотри на связку показов и кликов: если показы держатся, а клики просели, дело почти наверняка в том, что ответ дают выше твоей ссылки. Дальше остаётся проверить, пускает ли сайт тех, кто эти ответы собирает.

Три уровня доступа, о которых стоит знать

Тема доступа шире одного файла, и вот три уровня, на которых сайт может оказаться закрыт.

Первый — сам robots.txt, самый известный и самый частый: правило написано, боты его читают, доступ закрыт. Чинится за десять минут, но найти проблему без проверки почти нельзя, потому что для людей сайт работает нормально.

Второй уровень — защита на стороне сервера или CDN. Многие сервисы фильтруют автоматический трафик по умолчанию и режут ботов, которых не знают в лицо, так что формально в robots.txt всё открыто, а фактически краулер получает отказ и уходит. Такие случаи выявляются по логам: видно, что бот приходил и получил отказ.

Третий уровень самый обидный — страница открывается, бот пущен, а содержимого нет, потому что текст рисуется скриптами. Для машины это пустая страница, и никакой файл доступа тут не поможет, а проверяется это просмотром страницы глазами бота и лечится серверным рендерингом.

Порядок проверки логичный: сначала файл, потом логи, потом рендеринг. Каждый следующий уровень дороже в починке, поэтому начинать стоит с самого дешёвого — а чё тут думать?

С чего начать прямо сегодня

Открой свой robots.txt в браузере, он лежит по адресу с добавкой /robots.txt к домену, и посмотри глазами: есть ли там строки со сплошным запретом и упоминания ботов по именам. Если файл пустой или в нём только разрешения, у тебя, скорее всего, всё в порядке, и это хорошая новость.

Если там что-то есть, прогони домен через чекер и посмотри на группу цитирующих. Красное в этой группе — то, что стоит чинить сегодня, потому что каждый день с закрытым доступом это день, когда тебя не могли назвать в ответе.

И заведи привычку проверять файл после любых работ на сервере. Я у себя добавил эту проверку в список выкатки, и с тех пор вопрос закрыт: если кто-то случайно закроет ботов, это станет видно в тот же день, а не через полгода по кривой трафика.

Что делать, если сайт не твой

Ситуация частая: сайт клиента, доступа к серверу нет, а robots.txt закрыт наглухо. Спорить с разработчиками про ИИ-ботов бесполезно, если у тебя нет цифры, поэтому сначала собери цифру.

Возьми десять запросов, по которым клиент хочет быть виден, и проверь, есть ли по ним ответ ИИ и кто в нём цитируется. Если ответ есть, а клиента в нём нет, появляется аргумент: вот запросы, вот конкуренты в ответах, вот строка в файле, из-за которой меня там быть не может.

Дальше разговор идёт заметно проще, потому что обсуждается не абстрактная угроза, а конкретная потеря. По моему опыту правку согласуют в тот же день, если показать список конкурентов, которых видят вместо клиента: абстрактные разговоры про ИИ обычно откладывают на потом, а конкретный список фамилий соседей по нише — почти никогда.

Ну и последнее. Зачем закрывать ботов «на всякий случай»? Этот случай почти никогда не наступает, а цена решения выясняется через полгода и оплачивается трафиком.

Так что если всё зелёное — поздравляю, статья про свой сайт выйдет такой же скучной, как моя. Скучная — это хорошо!

👉 → Проверить доступ ИИ-ботов к своему сайту

Частые вопросы

Можно ли блокировать GPTBot и не пропасть из ChatGPT?

Да. GPTBot — обучающий краулер (кормит базовую модель), а поиск ChatGPT работает на OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Заблокируй GPTBot и оставь эти два — ты перестанешь отдавать контент на обучение, но останешься в ChatGPT Search и цитатах.

У меня нет robots.txt — это плохо для GEO?

Нет. Без robots.txt каждый краулер по умолчанию допущен — для видимости в ИИ-ответах это нормальное состояние. Проблемы начинаются, когда файл ЕСТЬ и в нём сплошной Disallow, под который попадают и цитирующие боты.

Чем блокировка цитирующего бота отличается от блокировки обучающего?

Ценой. Блокировка обучающего (GPTBot, CCBot, Google-Extended) — легитимный выбор «не обучайте модели на моём контенте», видимость в ИИ-поиске не страдает. Блокировка цитирующего (OAI-SearchBot, PerplexityBot, Claude-SearchBot) означает, что этот движок никогда не приведёт к тебе ни цитату, ни посетителя.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

  • …

Комментарии модерируются.