seo·matrix
← Все статьи

llms.txt — зачем он сайту и как его сделать

· 8 мин чтения · Автор Михаил Кузьмицкий

Markdown-версия ↗

Спойлер, чтобы не листать: llms.txt — это короткая курируемая карта сайта для ИИ-движков в Markdown, она лежит в корне рядом с robots.txt, не заменяет ни sitemap, ни robots и делается за час. Гарантий цитирования не даёт, но и не вредит, а вот одна невнимательная строка в robots.txt способна выпилить сайт из ответов ИИ целиком — и это, пожалуй, главное в тексте.

Про llms.txt я вспомнил не от хорошей жизни: разбирал сайт, у которого позиции в Google были на месте, а в ответах ChatGPT он не появлялся вообще. Открыл robots.txt — и увидел одну строку, которой закрыли GPTBot «чтобы не обучали», а заодно и OAI-SearchBot, который отвечает за цитирование. Карты для ИИ там, разумеется, тоже не было, но в этой истории она была бы третьей по важности.

llms.txt — это файл в корне сайта по адресу /llms.txt, который даёт движкам курируемую карту твоего контента в Markdown: что здесь есть, о чём это и что читать в первую очередь.

llms.txt — зачем он сайту и как его сделать

Зачем он нужен

Языковые модели ограничены и контекстом, и временем на чтение, поэтому им, как правило, приходится выбирать, что читать. Файл sitemap.xml перечисляет все адреса подряд, без приоритета и без пояснений, поэтому машине из него непонятно, что важно, а что служебная страница, и карта для ИИ решает ровно эту задачу: она короткая, отобранная и с описаниями.

Даёт ли это гарантию, что тебя начнут цитировать? Нет, конечно, и обещать такое было бы враньём! Но обходится дёшево, вреда не приносит, а на сайтах с сотнями страниц заметно повышает шанс, что движок дойдёт до нужного раздела, а не до случайного.

Чем отличается от sitemap.xml и robots.txt

sitemap.xmlrobots.txtllms.txt
Для когопоисковые краулерыботы (доступ)ИИ-движки и агенты
ФорматXML, все адресадирективыMarkdown, отобранное
Задачаобход всех страницчто можно и нельзячто важно прочитать
Контекстнетнетзаголовок и описание

Все три файла не конкурируют между собой, потому что решают разные задачи, и карта для ИИ дополняет остальные, а не заменяет их. Ставить вопрос «что из этого нужнее» бессмысленно — примерно как спрашивать, что нужнее, дверь или табличка на ней.

Как выглядит файл

# Название сайта

> Одно-два предложения: о чём сайт и для кого.

## Основные разделы
- [Услуги](https://site.tld/services/): что и для кого
- [Блог](https://site.tld/blog/): разборы по теме

## Опционально
- [О компании](https://site.tld/about/)
- [Контакты](https://site.tld/contact/)

Структура взята из спецификации: заголовок первого уровня с названием, цитата-описание, разделы со списками ссылок в формате «адрес и короткое пояснение», а второстепенное уходит в отдельный блок.

Как добавить, по шагам

  1. Сгруппируй страницы по смысловым кластерам и дай каждой ссылке одну строку описания.
  2. Отдели второстепенное — юридическое, служебное — в блок «Опционально».
  3. Держи компактным: описание до восьмидесяти слов, без сотни ссылок. Это карта, а не каталог!
  4. Положи файл в корень рядом с robots.txt, отдавая его как text/plain.
  5. По желанию собери llms-full.txt с полным текстом ключевых статей в том же порядке.

Частые ошибки

  • Дубль sitemap — вывалить все адреса без описаний, хотя смысл файла в приоритетах, а не в полноте.
  • Слишком длинно — простыня на сотни ссылок съедает контекст модели и работает против тебя.
  • Нет описаний — без пояснения, о чём страница, ссылка для машины почти бесполезна.
  • Забыли обновить — после переезда ссылки протухают ровно так же, как в обычной карте сайта.

Кто и как читает твой сайт

ИИ-боты — это не один робот, и делить их полезно на три класса, потому что блокировать их нужно осознанно:

  • Обучающие — их можно закрыть без потери видимости: GPTBot, ClaudeBot, CCBot.
  • Поисковые и цитирующие — закрыть их значит пропасть из ответов: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  • По запросу пользователя — ChatGPT-User, Claude-User, Perplexity-User: заходят, когда человек попросил ИИ открыть конкретную ссылку.

Самая частая и самая дорогая ошибка выглядит так: одной строкой закрывают GPTBot, а заодно случайно и OAI-SearchBot. Обучение запретили — и вместе с ним потеряли цитирование, причём заметить это можно только специальной проверкой, потому что позиции при этом не меняются вовсе. Ровно это я и увидел в robots.txt из завязки — и, судя по тому, как часто такое попадается, я там далеко не последний!

Два технических факта, из-за которых машиночитаемость решает. Первый: ИИ-краулеры не выполняют скрипты и видят только первый HTML-ответ, поэтому сайт, который рисует текст на клиенте, для них пуст. Второй: структурированные данные питают Knowledge Graph, а из него собираются сущности в ответах — это следует из материалов дела US v. Google.

Стоит ли делать это сейчас

Файл пока не обязательный стандарт, и читают его не все движки. Аргумент в пользу простой: стоит он час работы, не вредит ничему и уже поддерживается частью инструментов, а аргумент против тоже честный — гарантий никаких, и ждать от него скачка цитирований не стоит.

Так делать или нет? Мой вывод такой, и выскажу его как субъективный: делать имеет смысл после того, как закрыты вещи подороже. Сначала доступ ботов и рендеринг без скриптов, потом форма ответов на страницах, и только потом карта для ИИ, потому что в обратном порядке это красивый файл на сайте, который никто не может прочитать.

И последнее замечание, из практики поддержки. Файл удобно генерировать автоматически из той же структуры, что и меню сайта, — тогда он не протухает при добавлении разделов. Ручная сборка красивее — но кто вспомнит про неё через полгода? Живёт она ровно до первого редизайна, после которого про неё все забывают.

Коротко

  • llms.txt — курируемая карта сайта для ИИ в Markdown.
  • Не заменяет sitemap и robots, а дополняет их.
  • Боты бывают обучающие, цитирующие и по запросу — не закрой цитирующих случайно.
  • ИИ не исполняет скрипты, значит нужен серверный рендеринг.
  • llms-full.txt — весь ключевой текст одним файлом, для одного запроса.

Как проверить, что файл работает

Вопрос законный: файл лежит, а толку от него не видно — как понять, читают его вообще или нет? Прямого способа, к сожалению, нет, потому что движки не отчитываются о том, что заглянули в карту сайта, зато есть два косвенных признака, которые обычно достаточно надёжны.

Первый — логи доступа. Цитирующие боты ходят по сайту с узнаваемыми user-agent, и по логам видно, забирают ли они /llms.txt вообще; если за месяц ни одного обращения, файл пока никем не читается, и это вопрос времени, а не ошибки в разметке.

Второй признак интереснее: попадание в ответы тех страниц, которые ты в карте выделил. Если движок начал цитировать именно приоритетные разделы, а не случайные, — карта, возможно, сработала. Доказательством в строгом смысле это не является, но как рабочая гипотеза вполне годится, а других у нас и нет!

И третий, самый скучный совет: заведи привычку обновлять файл вместе с сайтом, потому что протухшая карта хуже её отсутствия — она уводит машину на страницы, которых больше нет, и обесценивает остальные ссылки. Раз в квартал пройтись по списку — минут пятнадцать работы, а польза заметная.

Что делать, если сайт большой

Отдельная история — сайты на тысячи страниц, где выбрать «важное» физически трудно, а соблазн выгрузить всё подряд особенно велик. Поддаваться ему не стоит, потому что длинная карта работает хуже короткой: модель читает начало и обрывается, не дойдя до середины списка.

Разумный подход выглядит так: возьми страницы, которые приносят деньги или отвечают на самые частые вопросы клиентов, и ограничь список сотней ссылок, а остальное пусть живёт в обычной карте сайта, для поисковых краулеров, которым полнота действительно нужна.

Второй приём для больших сайтов — раскладывать карту по разделам, а не по типам страниц, потому что машине важно понять структуру смысла: вот услуги, вот отраслевые решения, вот база знаний. Список из двухсот адресов без такой группировки читается как шум, каким бы аккуратным он ни был.

И, наконец, про приоритет внутри карты. Первые ссылки в каждом разделе получают больше внимания, поэтому в начале стоит ставить страницы, которые сам считаешь лучшими — с фактами, цифрами и внятными ответами, — а логика тут та же, что и внутри страницы: сначала главное, остальное потом.

Стоит ли ждать, что формат станет стандартом

Прогнозы тут дело неблагодарное, но пару соображений приведу. За llms.txt говорит то, что он решает реальную проблему машин: контекст ограничен, а сайты растут, и кому-то придётся объяснять модели, что читать первым. Против — то, что крупные движки предпочитают решать такие задачи сами, не полагаясь на файлы, которые владелец сайта заполняет как хочет (а заполняет он, как не сложно догадаться, в свою пользу).

Скорее всего, будущее окажется где-то посередине: файл останется полезной конвенцией для агентов и специализированных инструментов, но обязательным стандартом, вероятно, не станет. Примерно как в своё время получилось с некоторыми мета-тегами, которые все ставят, а вес у них небольшой.

Что из этого следует практически? Тратить на карту сайта для ИИ вечер один раз — разумно, строить вокруг неё стратегию видимости — нет. Работает по-прежнему содержание страниц и их доступность для чтения, а всё остальное лишь помогает машине быстрее до этого содержания добраться.

Так что сначала сходи в robots.txt и проверь, кого ты там закрыл, а карту допишешь потом — она подождёт, а цитирование нет.

Источники

  • llmstxt.org — спецификация формата llms.txt и llms-full.txt.
  • schema.org — типы структурированных данных.
  • Реестр ИИ-ботов (GEO-HowTo 2026) — классификация краулеров по роли и поведению.
  • US v. Google, материалы дела (2025) — роль Knowledge Graph в сборке ответов.

Частые вопросы

Чем llms.txt отличается от sitemap.xml?

sitemap.xml — машинный список всех URL для поисковых краулеров. llms.txt — курируемый Markdown-список только важных страниц с описаниями, который ИИ-движки читают, чтобы быстро понять, о чём сайт.

Где размещать llms.txt?

В корне сайта: /llms.txt. Опционально рядом кладут /llms-full.txt — полный текст ключевых страниц для ингеста за один запрос.

Стоит ли делать это уже сейчас?

Стандарт молодой и пока не гарантирует трафик, но он дешёвый, ничему не вредит и готовит сайт к ИИ-ингесту — разумная ставка на будущее.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

  • …

Комментарии модерируются.