seo·matrix
← Все статьи

Пускает ли ваш robots.txt ИИ? Проверили 6 известных сайтов бесплатным чекером

· 2 мин чтения · Автор Михаил Кузьмицкий

GEOИнструментыrobots.txt

Markdown-версия ↗

Пускает ли ваш robots.txt ИИ? Проверили 6 известных сайтов бесплатным чекером

У GEO есть вопрос №0, который идёт до капсул, разметки и llms.txt: может ли ИИ-движок вообще прочитать ваш сайт. Ответ лежит в robots.txt — и заблокированный там цитирующий бот не процитирует вас никогда, сколько бы вы ни оптимизировали контент. Проверяется это за десять секунд: чекер доступа ИИ-краулеров.

Что проверяет чекер

Вставляете домен — чекер читает живой robots.txt и раскладывает 27 ИИ-ботов на три группы с вердиктом «пускается/заблокирован» по каждому. Группы различаются ценой блокировки: цитирующие движки (14 UA: OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot и другие) — заблокировал и исчез из ответов этого движка; обучающие краулеры (11 UA: GPTBot, CCBot, Google-Extended…) — блокировка легитимна и видимости не вредит; устаревшие UA (anthropic-ai, cohere-ai) — правила на них мертвы.

Проверили шесть известных сайтов

Мы прогнали через чекер robots.txt шести крупных сайтов (снимок от 3 июля 2026; «заблокирован» = UA попадает под сплошной Disallow: /). Расклад показывает, что robots.txt давно стал не техническим файлом, а бизнес-позицией в переговорах с ИИ-компаниями:

СайтЦитирующих заблокировано (из 14)Обучающих (из 11)Что это значит
reddit.com1411закрыто всё; доступ только по контракту
nytimes.com99жёсткая лицензионная позиция
cnn.com1010аналогично
theverge.com109но OpenAI пущен — сделка Vox↔OpenAI видна прямо в robots.txt
bbc.com69середина
medium.com06образец: обучение закрыто, цитирование открыто

Самая показательная строка — The Verge: OAI-SearchBot и GPTBot допущены, остальные цитирующие закрыты. Лицензионное соглашение издателя с OpenAI читается в обычном текстовом файле.

Citation ≠ training: главная ошибка

Медиагиганты блокируют цитирующих ботов осознанно — это рычаг в лицензионных переговорах, и у NYT с Reddit он реально есть. Но когда обычный бизнес-сайт копирует их «рецепт защиты от ИИ», рычага нет — есть только тихое исчезновение из ChatGPT Search, Perplexity и Bing Copilot. Правильный паттерн для большинства — как у Medium: обучающие закрыты, цитирующие открыты.

На себе и как починить

Наш собственный robots.txt отдаёт User-agent: * + Allow: / — все 27 строк в чекере зелёные. Это скучный результат, и для большинства сайтов он же правильный: сначала видимость, опциональный опт-аут из обучения — потом. Если чекер показал красное, готовый файл под ваш выбор собирает генератор AI-friendly robots.txt, а доступ краулеров вместе с разметкой, капсулами и скоростью проверяет платный GEO/SEO-аудит.

→ Проверить доступ ИИ-ботов к своему сайту

Частые вопросы

Можно ли блокировать GPTBot и не пропасть из ChatGPT?

Да. GPTBot — обучающий краулер (кормит базовую модель), а поиск ChatGPT работает на OAI-SearchBot (индекс) и ChatGPT-User (загрузка страницы по запросу пользователя). Заблокируйте GPTBot и оставьте эти два — вы перестанете отдавать контент на обучение, но останетесь в ChatGPT Search и цитатах.

У меня нет robots.txt — это плохо для GEO?

Нет. Без robots.txt каждый краулер по умолчанию допущен — для видимости в ИИ-ответах это нормальное состояние. Проблемы начинаются, когда файл ЕСТЬ и в нём сплошной Disallow, под который попадают и цитирующие боты.

Чем блокировка цитирующего бота отличается от блокировки обучающего?

Ценой. Блокировка обучающего (GPTBot, CCBot, Google-Extended) — легитимный выбор «не обучайте модели на моём контенте», видимость в ИИ-поиске не страдает. Блокировка цитирующего (OAI-SearchBot, PerplexityBot, Claude-SearchBot) означает, что этот движок никогда не приведёт к вам ни цитату, ни посетителя.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

Комментарии модерируются.