llmsmap.ru

Практическое руководство · обновлено в 2026

Форматы и стандарты для ИИ-краулинга: llms.txt, llms-full.txt, ai.txt, robots.txt

llms.txt и ai.txt — развивающиеся конвенции, а не официальные веб-стандарты. Разбираем назначение, формат и расположение четырёх файлов. Их публикация может упростить работу совместимых инструментов, но не гарантирует обход, индексацию или цитирование.

Четыре машиночитаемых файла передают правила доступа, структуру, полный контекст и политику использования ИИ-агенту
robots.txtдоступ к обходу
llms.txtотобранный контекст
llms-full.txtглубокий материал
ai.txtправила использования
01

llms.txt

Краткая сводка о сайте для больших языковых моделей (LLM).

Файл llms.txt предложен как единый способ подачи отобранного контекста для ИИ. Он пишется в простом текстовом формате с заголовками и ссылками, что удобно для машинной обработки и оценки объёма.

Главная идея — дать совместимому инструменту компактную выжимку: название проекта, краткое описание и упорядоченный список важных страниц. Само наличие файла не гарантирует обход, индексацию или появление сайта в ответах ИИ.

Подходит для сайтов любого размера: от лендинга до большой документации. Для крупных проектов дополнительно публикуется llms-full.txt.

Даёт ИИ-ассистентам и LLM-краулерам быстрый обзор содержимого сайта: что это за проект, ключевые разделы и ссылки. Аналог sitemap, но ориентированный на машинное чтение в формате Markdown-подобного текста.
02

llms-full.txt

Расширенная версия с подробным описанием всего контента сайта.

llms-full.txt — это «полная» версия llms.txt. Если llms.txt — это оглавление, то llms-full.txt — сама книга в текстовом виде.

Файл может достигать сотен тысяч и миллионов токенов, поэтому его размер и оценка токенов критичны при планировании контекстного окна модели.

Рекомендуется публиковать вместе с llms.txt: краткая сводка для быстрого обзора и полная версия — для глубокого анализа.

Предоставляет LLM полный текстовый контент сайта для прямой обработки без необходимости обхода страниц. Используется, когда модели нужен максимум контекста.
03

ai.txt

Файл-инструкция для ИИ-агентов: что можно и нельзя делать с контентом.

ai.txt решает вопрос «что разрешено делать ИИ с моим контентом». Это набор директив для искусственного интеллекта, аналогичный по духу robots.txt, но ориентированный на AI-агентов.

Типичные поля: разрешение/запрет на обучение моделей, условие указания источника, ограничения на коммерческое использование, контакты для запроса прав.

В отличие от llms.txt, который описывает содержимое, ai.txt описывает права и правила использования этого содержимого ИИ-системами.

Задаёт правила взаимодействия автоматических ИИ-систем и агентов с контентом сайта: разрешение на обучение, цитирование, суммаризацию, требования к атрибуции.
04

robots.txt

Классический стандарт управления доступом поисковых роботов.

robots.txt — самый старый и общепринятый стандарт из четырёх. Он не предназначен специально для ИИ, но остаётся базовым механизмом управления краулингом.

Директива Disallow блокирует обход URL, Sitemap указывает расположение карты сайта, Crawl-delay задаёт задержку между запросами.

В контексте ИИ-краулинга robots.txt дополняет llms.txt: первый управляет «можно ли заходить», второй — «что внутри, когда зашли».

Управляет доступом краулеров к разделам сайта: какие URL разрешены или запрещены к обходу, где находится sitemap. Не управляет индексацией напрямую, но направляет роботов.

Рекомендуемый порядок внедрения

  1. 1

    Проверьте доступ

    Настройте robots.txt и убедитесь, что нужные ИИ-боты не блокируются WAF или CDN.

  2. 2

    Соберите короткий контекст

    Опубликуйте llms.txt с назначением сайта и отобранными каноническими страницами.

  3. 3

    Добавьте глубину

    Для документации и базы знаний сформируйте llms-full.txt и контролируйте его объём.

  4. 4

    Зафиксируйте политику

    Опишите в ai.txt условия цитирования, обучения и коммерческого использования, если они важны.

Сравнительная таблица

Краткое сопоставление четырёх стандартов по ключевым параметрам.

Параметрllms.txtllms-full.txtai.txtrobots.txt
НазначениеКраткое описание сайта для LLMПолный контент сайта для LLMПравила использования контента ИИДоступ краулеров к URL
ФорматТекст (Markdown-подобный)Большой текстТекст / JSONТекст (директивы)
Расположение/llms.txt/llms-full.txt/ai.txt/robots.txt
ОбъёмНебольшойБольшой (до млн токенов)СреднийМаленький
АудиторияLLM, ИИ-ассистентыLLM, RAG-системыAI-краулеры, агрегаторыПоисковые роботы
Статуспредложение llmstxt.orgрасширение предложенияcommunity-конвенцияRFC 9309
УправляетСодержимым для ИИОбъёмом контекстаПравами использованияДоступом к обходу

Частые вопросы

Нужны ли сайту сразу все четыре файла?+

Нет. Начните с корректного robots.txt и компактного llms.txt. llms-full.txt полезен для больших баз знаний и документации, а ai.txt — когда нужно явно описать правила использования контента ИИ.

Заменяет ли llms.txt sitemap.xml или Schema.org?+

Нет. llms.txt даёт ИИ-системе отобранный контекст, sitemap.xml помогает обнаруживать URL, а Schema.org объясняет сущности и типы данных на страницах. Они дополняют друг друга.

Гарантирует ли llms.txt попадание в ответы нейросетей?+

Нет. Файл упрощает понимание сайта, но итоговая видимость зависит от доступности страниц, качества и уникальности контента, цитируемости, технической разметки и правил конкретной ИИ-системы.

Где размещать файлы?+

Публикуйте их в корне хоста: /llms.txt, /llms-full.txt, /ai.txt и /robots.txt. Для каждого поддомена правила и файлы лучше настраивать отдельно.

Форматы и стандарты для ИИ-краулинга: llms.txt, ai.txt, robots.txt — llmsmap.ru