Практическое руководство · обновлено в 2026
Форматы и стандарты для ИИ-краулинга: llms.txt, llms-full.txt, ai.txt, robots.txt
llms.txt и ai.txt — развивающиеся конвенции, а не официальные веб-стандарты. Разбираем назначение, формат и расположение четырёх файлов. Их публикация может упростить работу совместимых инструментов, но не гарантирует обход, индексацию или цитирование.

llms.txt
Краткая сводка о сайте для больших языковых моделей (LLM).
Файл llms.txt предложен как единый способ подачи отобранного контекста для ИИ. Он пишется в простом текстовом формате с заголовками и ссылками, что удобно для машинной обработки и оценки объёма.
Главная идея — дать совместимому инструменту компактную выжимку: название проекта, краткое описание и упорядоченный список важных страниц. Само наличие файла не гарантирует обход, индексацию или появление сайта в ответах ИИ.
Подходит для сайтов любого размера: от лендинга до большой документации. Для крупных проектов дополнительно публикуется llms-full.txt.
Даёт ИИ-ассистентам и LLM-краулерам быстрый обзор содержимого сайта: что это за проект, ключевые разделы и ссылки. Аналог sitemap, но ориентированный на машинное чтение в формате Markdown-подобного текста.
llms-full.txt
Расширенная версия с подробным описанием всего контента сайта.
llms-full.txt — это «полная» версия llms.txt. Если llms.txt — это оглавление, то llms-full.txt — сама книга в текстовом виде.
Файл может достигать сотен тысяч и миллионов токенов, поэтому его размер и оценка токенов критичны при планировании контекстного окна модели.
Рекомендуется публиковать вместе с llms.txt: краткая сводка для быстрого обзора и полная версия — для глубокого анализа.
Предоставляет LLM полный текстовый контент сайта для прямой обработки без необходимости обхода страниц. Используется, когда модели нужен максимум контекста.
ai.txt
Файл-инструкция для ИИ-агентов: что можно и нельзя делать с контентом.
ai.txt решает вопрос «что разрешено делать ИИ с моим контентом». Это набор директив для искусственного интеллекта, аналогичный по духу robots.txt, но ориентированный на AI-агентов.
Типичные поля: разрешение/запрет на обучение моделей, условие указания источника, ограничения на коммерческое использование, контакты для запроса прав.
В отличие от llms.txt, который описывает содержимое, ai.txt описывает права и правила использования этого содержимого ИИ-системами.
Задаёт правила взаимодействия автоматических ИИ-систем и агентов с контентом сайта: разрешение на обучение, цитирование, суммаризацию, требования к атрибуции.
robots.txt
Классический стандарт управления доступом поисковых роботов.
robots.txt — самый старый и общепринятый стандарт из четырёх. Он не предназначен специально для ИИ, но остаётся базовым механизмом управления краулингом.
Директива Disallow блокирует обход URL, Sitemap указывает расположение карты сайта, Crawl-delay задаёт задержку между запросами.
В контексте ИИ-краулинга robots.txt дополняет llms.txt: первый управляет «можно ли заходить», второй — «что внутри, когда зашли».
Управляет доступом краулеров к разделам сайта: какие URL разрешены или запрещены к обходу, где находится sitemap. Не управляет индексацией напрямую, но направляет роботов.
Рекомендуемый порядок внедрения
- 1
Проверьте доступ
Настройте robots.txt и убедитесь, что нужные ИИ-боты не блокируются WAF или CDN.
- 2
Соберите короткий контекст
Опубликуйте llms.txt с назначением сайта и отобранными каноническими страницами.
- 3
Добавьте глубину
Для документации и базы знаний сформируйте llms-full.txt и контролируйте его объём.
- 4
Зафиксируйте политику
Опишите в ai.txt условия цитирования, обучения и коммерческого использования, если они важны.
Сравнительная таблица
Краткое сопоставление четырёх стандартов по ключевым параметрам.
| Параметр | llms.txt | llms-full.txt | ai.txt | robots.txt |
|---|---|---|---|---|
| Назначение | Краткое описание сайта для LLM | Полный контент сайта для LLM | Правила использования контента ИИ | Доступ краулеров к URL |
| Формат | Текст (Markdown-подобный) | Большой текст | Текст / JSON | Текст (директивы) |
| Расположение | /llms.txt | /llms-full.txt | /ai.txt | /robots.txt |
| Объём | Небольшой | Большой (до млн токенов) | Средний | Маленький |
| Аудитория | LLM, ИИ-ассистенты | LLM, RAG-системы | AI-краулеры, агрегаторы | Поисковые роботы |
| Статус | предложение llmstxt.org | расширение предложения | community-конвенция | RFC 9309 |
| Управляет | Содержимым для ИИ | Объёмом контекста | Правами использования | Доступом к обходу |
Частые вопросы
Нужны ли сайту сразу все четыре файла?+
Нет. Начните с корректного robots.txt и компактного llms.txt. llms-full.txt полезен для больших баз знаний и документации, а ai.txt — когда нужно явно описать правила использования контента ИИ.
Заменяет ли llms.txt sitemap.xml или Schema.org?+
Нет. llms.txt даёт ИИ-системе отобранный контекст, sitemap.xml помогает обнаруживать URL, а Schema.org объясняет сущности и типы данных на страницах. Они дополняют друг друга.
Гарантирует ли llms.txt попадание в ответы нейросетей?+
Нет. Файл упрощает понимание сайта, но итоговая видимость зависит от доступности страниц, качества и уникальности контента, цитируемости, технической разметки и правил конкретной ИИ-системы.
Где размещать файлы?+
Публикуйте их в корне хоста: /llms.txt, /llms-full.txt, /ai.txt и /robots.txt. Для каждого поддомена правила и файлы лучше настраивать отдельно.