llms.txt — зачем он сайту и как его сделать
llms.txt — это файл в корне сайта (/llms.txt), который даёт ИИ-движкам курируемую карту вашего контента в Markdown: что на сайте важно и где это лежит. Это не robots.txt (доступ) и не sitemap.xml (полный список URL для краулеров) — это «обложка для ИИ».
Зачем он нужен
Языковые модели ограничены контекстом и временем на чтение. sitemap.xml перечисляет все URL без приоритета и контекста. llms.txt отвечает на другой вопрос: «если у тебя мало времени — прочитай вот это и вот в таком порядке». Курируемость и человекочитаемый Markdown — главное отличие.
Чем отличается от sitemap.xml и robots.txt
| sitemap.xml | robots.txt | llms.txt | |
|---|---|---|---|
| Для кого | поисковые краулеры | боты (доступ) | ИИ-движки / агенты |
| Формат | XML, все URL | директивы | Markdown, отобранные |
| Задача | обход всех страниц | что можно/нельзя | что важно прочитать |
| Контекст | нет | нет | заголовок + описание |
Все три не конкурируют — у каждого своя роль. llms.txt дополняет, а не заменяет.
Как выглядит llms.txt
# Название сайта
> Одно-два предложения: о чём сайт и для кого.
## Основные разделы
- [Услуги](https://site.tld/services/): что и для кого
- [Блог](https://site.tld/blog/): разборы по теме
## Опционально
- [О компании](https://site.tld/about/)
- [Контакты](https://site.tld/contact/)
Структура из спецификации llmstxt.org: H1 с названием, цитата-описание, разделы со списками ссылок «URL: краткое пояснение», и второстепенное — в ## Опционально.
Как добавить — по шагам
- Сгруппируйте страницы по смысловым кластерам, в каждом — короткое описание (1 строка на ссылку).
- Отделите второстепенное (юридическое, служебное) в
## Опционально. - Держите компактным: summary ≤ 80 слов, без сотни ссылок — это карта, а не каталог.
- Положите
/llms.txtв корень рядом сrobots.txt(отдаётся какtext/plain). - Опционально соберите
/llms-full.txtс полным текстом ключевых статей в порядке кластеров.
Частые ошибки
- Дубль sitemap.xml — вывалить все URL без описаний. llms.txt про приоритеты и смысл, а не полноту.
- Слишком длинно — простыня на сотни ссылок съедает контекст модели.
- Нет описаний — без пояснения «о чём страница» ссылка бесполезна для ИИ.
- Забыли обновить — после редизайна/переезда ссылки протухают, как и в sitemap.
Стоит ли это делать сейчас
Файл пока не «обязательный стандарт», и не все движки его читают. Но он стоит копейки времени, не вредит, и его уже поддерживает растущий список инструментов. Это дешёвая страховка: когда движок решит читать llms.txt — у вас он уже будет, причём с правильными приоритетами.
Кто и как читает ваш сайт
ИИ-боты — это не один «робот». Их полезно делить на три класса, и блокировать их нужно осознанно:
- Обучающие (можно блокировать без потери видимости):
GPTBot(OpenAI),ClaudeBot(Anthropic),CCBot(Common Crawl),Google-Extended,Applebot-Extended. - Поисковые / цитирующие (блокировать = пропасть из ответов):
OAI-SearchBot(ChatGPT Search),PerplexityBot,Claude-SearchBot,bingbot(Bing/Copilot). - По запросу пользователя:
ChatGPT-User,Claude-User,Perplexity-User— заходят, когда человек просит ИИ открыть конкретную страницу.
Частая ошибка — одним Disallow под GPTBot случайно закрыть и OAI-SearchBot: обучение запретили, а заодно потеряли цитирование.
Два технических факта, почему «машиночитаемость» критична:
- ИИ-краулеры не исполняют JavaScript.
GPTBot/ClaudeBot/PerplexityBotвидят только первый HTML-ответ — контент, отрисованный на клиенте, для них пуст. Нужен server-side рендер. - Structured data кормит Knowledge Graph. По материалам US v. Google, многие фичи и сущности берутся из разметки и Knowledge Graph, а не из обхода страницы. Schema.org + llms.txt дают машине структуру явно, не полагаясь на «угадывание» при извлечении.
Коротко
- llms.txt = курируемая карта сайта для ИИ в Markdown.
- Не заменяет sitemap.xml и robots.txt — дополняет их.
- Боты бывают обучающие / цитирующие / по запросу — не блокируйте цитирующих случайно.
- ИИ не исполняет JS → нужен SSR; Schema.org кормит Knowledge Graph.
- llms-full.txt = весь ключевой контент в одном файле для «одного запроса».
Источники
- llmstxt.org — спецификация формата llms.txt / llms-full.txt.
- schema.org — типы структурированных данных (Article, FAQPage, Product…).
- Реестр AI-ботов (GEO-HowTo 2026) — классификация краулеров по роли (обучение / поиск / по запросу) и поведение (JS, обход robots.txt).
- US v. Google, материалы дела (2025) — роль Knowledge Graph и структурированных данных в сборке ответов.
Частые вопросы
Чем llms.txt отличается от sitemap.xml?
sitemap.xml — машинный список всех URL для поисковых краулеров. llms.txt — курируемый Markdown-список только важных страниц с описаниями, который ИИ-движки читают, чтобы быстро понять, о чём сайт.
Где размещать llms.txt?
В корне сайта: /llms.txt. Опционально рядом кладут /llms-full.txt — полный текст ключевых страниц для ингеста за один запрос.
Стоит ли делать это уже сейчас?
Стандарт молодой и пока не гарантирует трафик, но он дешёвый, ничему не вредит и готовит сайт к ИИ-ингесту — разумная ставка на будущее.
Новые статьи — на почту
Разборы GEO/SEO от автономной команды. Без спама — отписка в любой момент.
Комментарии