seo·matrix
← Все статьи

llms-full.txt: файл, в котором AI-движки читают весь ваш сайт целиком

· 4 мин чтения · Автор Михаил Кузьмицкий

GEOAIllms.txt

Markdown-версия ↗

llms-full.txt: файл, в котором AI-движки читают весь ваш сайт целиком

Коротко: llms.txt — это курируемое оглавление сайта; llms-full.txt — сам сайт: чистый текст каждой значимой страницы, склеенный в один файл. AI-движок ответов (или любой RAG-краулер), который его читает, получает весь ваш контекст за один запрос: нечего рендерить, нечего очищать от навигации, не нужен обход в 40 запросов. Это файл-спутник к однострочному оглавлению llms.txt, и в 2026 году это один из самых дешёвых GEO-ходов.

llms.txt против llms-full.txt

Осьllms.txtllms-full.txt
Назначениекурируемая картаполный текстовый дамп
Содержимоессылки + описания в строкуреальные тела страниц
Размермаленький (меню)большой (всё блюдо)
Кто читаетмодель решает, что забратьмодель читает всё сразу
Аналогияоглавлениесама книга в чистом тексте

Это не конкуренты — это пара. llms.txt говорит модели, что существует, и ссылается на markdown по страницам; llms-full.txt позволяет модели пропустить round-trip’ы и проглотить всё за один заход.

Почему один большой файл лучше обхода

Краулер по вашему отрендеренному HTML проваливается тремя обычными способами: не может выполнить ваш JavaScript, тратит бюджет на обвязку (навигация/футер/куки), и ему нужен один запрос на страницу. Один чистый текстовый файл убирает все три сразу.

  • Нет шага рендера. Контент уже текст. Клиентские SPA — классическая GEO-чёрная дыра — становятся полностью читаемыми.
  • Нет обвязки для очистки. Вы отдаёте только тела, соотношение сигнал/шум ~100%.
  • Один запрос, полный контекст. Модель, сравнивающая ваши тарифы с конкурентом, держит в контексте всё ваше предложение, а не угадывает по одной странице.

Что в него класть

Чистые markdown-тела, в стабильном порядке, каждое с достаточным front-matter, чтобы модель могла атрибутировать пассаж:

  • Заголовок страницы и канонический URL как heading, чтобы цитата могла сослаться назад.
  • Тело как markdown — заголовки, списки, таблицы сохранены; скрипты, навигация, реклама и куки-баннеры убраны.
  • Видимую дату (published / updated) — свежесть это реальный GEO-сигнал.
  • Ничего, что вы не опубликовали бы. Файл публичный и цитируется дословно.

Ставьте самые важные страницы первыми (денежные страницы, вечнозелёные гайды), потому что часть краулеров обрезает длинные файлы.

Что оставить за бортом

Как выкатить

Три способа, дешёвый первый:

  1. Сгенерировать из источника контента. Если страницы в markdown или в CMS с экспортом — склейте тела с шапкой title/URL/дата на страницу. Именно это делает наш GEO-тулкит автоматически: он отдаёт llms.txt, llms-full.txt и per-page .md-альтернативу за один проход.
  2. Добавить per-page markdown-альтернативу. Отдавайте чистый markdown каждой страницы по предсказуемому URL и анонсируйте его через <link rel="alternate" type="text/markdown" href="…">. Тогда llms.txt ссылается на них, а llms-full.txt их встраивает.
  3. Разместить в корне и сослаться. Положите файл в /llms-full.txt, сошлитесь из /llms.txt и держите оба в сборке, чтобы они не расходились с сайтом.

Это реально что-то меняет?

Честно: поддержка неровная, и это не задокументированный фактор ранжирования ни у одного крупного движка. Что он надёжно делает — убирает причины провала: стену рендера и стену краул-бюджета, из-за которых JS-тяжёлые и глубокие сайты вообще не попадают в AI-ответы. Для клиентски-рендеримого сайта эта разница — между «невидим для RAG» и «полностью читаем».

Где GEO-краулеры теряют ваш контент (типичные провалы на JS-тяжёлом сайте)
Рендер JS падает 100%
Как чистый markdown 0%

источник: внутренние аудиты, 2026

График и есть весь аргумент: клиентски-рендеримую страницу, которую краулер не может выполнить, он не видит на 100%; та же страница строкой в llms-full.txt читается на 100%.

Чеклист

  • /llms.txt существует (курируемое оглавление, ссылки на markdown по страницам).
  • /llms-full.txt существует (полные чистые тела, один файл).
  • У каждой записи есть title, канонический URL и видимая дата.
  • Нет HTML, навигации и бойлерплейта — только тела.
  • Важные страницы первыми; тонкие/дубли исключены.
  • Оба файла пересобираются при каждой сборке (не устаревают).
  • Per-page .md-альтернативы анонсированы через rel="alternate".

Коротко

  • llms.txt — оглавление; llms-full.txt — весь сайт одним чистым текстовым файлом.
  • Один запрос заменяет рендер, очистку от обвязки и много-запросный обход.
  • Это сантехника: убирает причины, по которым AI-движки вас пропускают, но не ранжирует.
  • Только тела, важное первым, с title + URL + датой на страницу.
  • Выкатите оба, свяжите их и пересобирайте при каждой сборке, чтобы не устаревали.

Источники

  • llmstxt.org — исходное предложение /llms.txt (Jeremy Howard, 2024) и конвенция llms-full.txt / расширенного контекста.
  • Aggarwal et al., «GEO», KDD ‘24arXiv:2311.09735: цитируемость зависит от извлекаемости пассажа, которую чистый текст максимизирует.
  • Google, «Rendering on the Web» — почему клиентский JavaScript это провал извлечения, когда фетчер не может его выполнить.

Частые вопросы

Чем llms.txt отличается от llms-full.txt?

llms.txt — короткое курируемое оглавление: markdown-список ключевых страниц со ссылками и однострочными описаниями. llms-full.txt — расширенная версия: реальные чистые тексты этих страниц, встроенные в один файл, чтобы модель получила весь контент за один запрос вместо обхода каждой ссылки.

AI-движки правда читают llms-full.txt?

Это формирующаяся конвенция (llmstxt.org), а не сигнал ранжирования. Поддержка неровная у ChatGPT, Perplexity и Google, но выкатить файл почти ничего не стоит, он тривиально машиночитаем и убирает рендер JavaScript и краул-бюджет как причины провала для тех краулеров, которые его читают.

Куда класть llms-full.txt?

В корень сайта: /llms-full.txt, отдавать как text/plain или text/markdown и сослаться из /llms.txt. Держите оба актуальными — устаревший контекст-файл хуже, чем его отсутствие.

Помогла статья?
Запустить SEO/GEO с seo·matrix → или заявка без Telegram →

Комментарии

Комментарии модерируются.