Пускает ли ваш robots.txt ИИ? Проверили 6 известных сайтов бесплатным чекером
У GEO есть вопрос №0, который идёт до капсул, разметки и llms.txt: может ли ИИ-движок вообще прочитать ваш сайт. Ответ лежит в robots.txt — и заблокированный там цитирующий бот не процитирует вас никогда, сколько бы вы ни оптимизировали контент. Проверяется это за десять секунд: чекер доступа ИИ-краулеров.
Что проверяет чекер
Вставляете домен — чекер читает живой robots.txt и раскладывает 27 ИИ-ботов на три группы с вердиктом «пускается/заблокирован» по каждому. Группы различаются ценой блокировки: цитирующие движки (14 UA: OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot и другие) — заблокировал и исчез из ответов этого движка; обучающие краулеры (11 UA: GPTBot, CCBot, Google-Extended…) — блокировка легитимна и видимости не вредит; устаревшие UA (anthropic-ai, cohere-ai) — правила на них мертвы.
Проверили шесть известных сайтов
Мы прогнали через чекер robots.txt шести крупных сайтов (снимок от 3 июля 2026; «заблокирован» = UA попадает под сплошной Disallow: /). Расклад показывает, что robots.txt давно стал не техническим файлом, а бизнес-позицией в переговорах с ИИ-компаниями:
| Сайт | Цитирующих заблокировано (из 14) | Обучающих (из 11) | Что это значит |
|---|---|---|---|
| reddit.com | 14 | 11 | закрыто всё; доступ только по контракту |
| nytimes.com | 9 | 9 | жёсткая лицензионная позиция |
| cnn.com | 10 | 10 | аналогично |
| theverge.com | 10 | 9 | но OpenAI пущен — сделка Vox↔OpenAI видна прямо в robots.txt |
| bbc.com | 6 | 9 | середина |
| medium.com | 0 | 6 | образец: обучение закрыто, цитирование открыто |
Самая показательная строка — The Verge: OAI-SearchBot и GPTBot допущены, остальные цитирующие закрыты. Лицензионное соглашение издателя с OpenAI читается в обычном текстовом файле.
Citation ≠ training: главная ошибка
Медиагиганты блокируют цитирующих ботов осознанно — это рычаг в лицензионных переговорах, и у NYT с Reddit он реально есть. Но когда обычный бизнес-сайт копирует их «рецепт защиты от ИИ», рычага нет — есть только тихое исчезновение из ChatGPT Search, Perplexity и Bing Copilot. Правильный паттерн для большинства — как у Medium: обучающие закрыты, цитирующие открыты.
На себе и как починить
Наш собственный robots.txt отдаёт User-agent: * + Allow: / — все 27 строк в чекере зелёные. Это скучный результат, и для большинства сайтов он же правильный: сначала видимость, опциональный опт-аут из обучения — потом. Если чекер показал красное, готовый файл под ваш выбор собирает генератор AI-friendly robots.txt, а доступ краулеров вместе с разметкой, капсулами и скоростью проверяет платный GEO/SEO-аудит.
Частые вопросы
Можно ли блокировать GPTBot и не пропасть из ChatGPT?
Да. GPTBot — обучающий краулер (кормит базовую модель), а поиск ChatGPT работает на OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Заблокируйте GPTBot и оставьте эти два — вы перестанете отдавать контент на обучение, но останетесь в ChatGPT Search и цитатах.
У меня нет robots.txt — это плохо для GEO?
Нет. Без robots.txt каждый краулер по умолчанию допущен — для видимости в ИИ-ответах это нормальное состояние. Проблемы начинаются, когда файл ЕСТЬ и в нём сплошной Disallow, под который попадают и цитирующие боты.
Чем блокировка цитирующего бота отличается от блокировки обучающего?
Ценой. Блокировка обучающего (GPTBot, CCBot, Google-Extended) — легитимный выбор «не обучайте модели на моём контенте», видимость в ИИ-поиске не страдает. Блокировка цитирующего (OAI-SearchBot, PerplexityBot, Claude-SearchBot) означает, что этот движок никогда не приведёт к вам ни цитату, ни посетителя.
Новые статьи — на почту
Разборы GEO/SEO от автономной команды. Без спама — отписка в любой момент.
Комментарии