# AI-friendly robots.txt

_Источник: https://seomatrix.ai/ru/tools/robots-generator/_

---

## Что делает

robots.txt — это текстовый файл в корне домена, который указывает каждому краулеру — и поисковым системам, и ИИ-движкам ответов — какие URL ему разрешено загружать. Этот генератор собирает robots.txt так, чтобы нужные боты (Googlebot, Bingbot, OAI-SearchBot, PerplexityBot) оставались полностью разрешёнными и ваши страницы попадали в индекс и в цитаты ИИ-ответов, а обучающих ИИ-краулеров при желании можно заблокировать. Ошибка в правилах — и вы незаметно пропадаете из ChatGPT, Perplexity и обзоров Google (AI Overviews).

## Что проверяет

- **User-agent поисковых ботов** — Отдельные правила для Googlebot и Bingbot; их разрешение открывает доступ в индексы, из которых берут данные и обычный поиск, и AI Overviews от Google.
- **Краулеры ИИ-ответов** — Боты OAI-SearchBot (поиск ChatGPT), PerplexityBot и Claude-SearchBot загружают живые страницы для цитирования в ответах, поэтому их блокировка полностью убирает вас из этих цитат.
- **Обучающие ИИ-краулеры** — GPTBot, CCBot и Google-Extended собирают тексты для обучения моделей, и их можно заблокировать отдельно, не теряя видимости в поиске и цитатах.
- **Разделение цитирования и обучения** — Боты ответов и боты обучения — это разные user-agent, поэтому корректный robots.txt может разрешить цитирование и запретить обучение модели — ключевой приём, который упускает большинство сайтов.
- **Директива Sitemap** — Строка Sitemap: со ссылкой на XML-карту помогает каждому краулеру найти все ваши URL за один проход, а не полагаться на переходы по ссылкам.
- **Пути в Disallow** — Явные правила Disallow закрывают админку, корзину и дубли URL, чтобы краулеры тратили лимит обхода на страницы, которые вы действительно хотите видеть в цитатах.

## Как пользоваться

1. Выберите, каких краулеров разрешить и блокировать ли обучающих ИИ-ботов, затем сгенерируйте файл.
2. Скопируйте или скачайте готовый robots.txt и загрузите его в корень домена по адресу /robots.txt.
3. Проверьте, что он открывается по адресу вашдомен.com/robots.txt, и перепроверяйте после смены CMS или хостинга.

## Вопросы

### Помешает ли блокировка GPTBot цитированию сайта в ChatGPT?

Нет. GPTBot — это обучающий краулер OpenAI, а живые цитаты в ChatGPT берёт OAI-SearchBot. Заблокируйте GPTBot и разрешите OAI-SearchBot, чтобы сохранить цитаты и при этом отказаться от обучения.

### Куда класть robots.txt?

В корень домена, по адресу https://вашдомен.com/robots.txt. Файл действует только на тот хост, где лежит, — для поддоменов нужен свой robots.txt.

### Скроет ли robots.txt страницу из поиска?

Не гарантированно. Disallow запрещает обход, но страница всё равно может попасть в индекс, если на неё ссылаются другие сайты; чтобы убрать её из выдачи, используйте мета-тег или заголовок noindex.

### Стоит ли вообще блокировать ИИ-краулеров?

Только обучающих и только если вы не хотите, чтобы контент использовали для обучения моделей. Блокировка краулеров ответов вроде PerplexityBot убирает вас из ИИ-ответов, и это обычно стоит больше видимости, чем защищает.

