llms.txt — не официальный стандарт W3C, а сложившаяся практика: markdown-файл в корне домена, адресованный ИИ-агентам напрямую, по аналогии с тем, как robots.txt адресован краулерам. Формального валидатора не существует, но есть общий консенсус по структуре. Ниже — чек-лист, собранный из того, что реально работает.
Обязательный минимум
- Заголовок первого уровня с названием бренда/сайта. Это первое, что должен увидеть агент.
- Однострочное описание сразу под заголовком (в формате blockquote, начинается с
>) — что за сайт, чем занимается, в одном предложении без маркетингового языка. - Список ключевых разделов с прямыми ссылками. Не просто названия — рабочие абсолютные URL, чтобы агент мог перейти сразу, не угадывая структуру сайта.
Что усиливает файл
- Краткое описание под каждой ссылкой — одно предложение о том, что именно на этой странице, а не просто название раздела.
- Блок «важные факты для цитирования» — 3–5 буллетов с конкретными фактами о бизнесе (цены, форматы, контакты), которые агент может процитировать без захода на сайт.
- Ссылка на llms-full.txt, если он есть — единый файл с полным содержимым ключевых страниц для агентов, которым не нужно ходить по сайту постранично.
Частые ошибки
- Файл лежит не в корне домена.
example.com/llms.txt, а не в подпапке — иначе часть агентов его просто не найдёт по умолчанию. - Файл раздут маркетинговым текстом с сайта. Разумный ориентир — держать сам краткий llms.txt компактным (агенты обрабатывают тысячи таких файлов и не читают лишнее), а весь объём фактуры выносить в отдельный llms-full.txt, а не пытаться впихнуть всё в один файл. llms.txt — справочный документ, а не ещё одна посадочная страница; хвалебные прилагательные без фактов агенту бесполезны.
- Файл не обновляется при добавлении новых страниц или изменении бизнес-модели. Устаревший llms.txt хуже, чем его отсутствие — агент получает неполную или неверную карту сайта (например, старые тарифы или снятые с продажи услуги) и на основе неё может дать неверный ответ.
- Никто не проверил, что файл вообще отдаётся с правильным content-type и не блокируется тем же правилом, что защищает служебные файлы.
Что первично, а что вторично
llms.txt бесполезен, если сайт технически не пускает ИИ-краулеров — сначала robots.txt с явным Allow для GPTBot, ClaudeBot, PerplexityBot и подобных, потом структурированные данные (Schema.org) на самих страницах, и только потом llms.txt как краткая карта поверх всего этого. Подробный разбор порядка — в посте про llms.txt и Schema.org. Если сайт большой и структура сложная, а разбираться с этим самостоятельно не хочется — это ровно то, что входит в услугу технической оптимизации под ИИ-краулеры.
Спор в индустрии: полезность llms.txt не общепризнана
Внедрение llms.txt — не бесспорная практика. В индустрии есть разногласия относительно того, насколько этот файл влияет на поведение ИИ-агентов. Некоторые крупные ИИ-компании публично выражали скепсис: их системы либо не используют llms.txt при генерации ответов, либо обращаются к нему непоследовательно. Представители одной из ведущих поисковых систем заявляли, что их модели не обучены читать и интерпретировать markdown-файлы в корне домена. Другие разработчики языковых моделей указывали, что приоритетом для них остаётся прямой контент страниц (HTML), а не вспомогательные мета-файлы.
При этом часть агентств и площадок по управлению контентом всё равно советуют внедрять llms.txt как минимальную меру предосторожности. Аргументация: файл не вредит, не замедляет загрузку сайта, не требует сложной поддержки, но потенциально может дать преимущество в тех сценариях, где агент действительно его читает. Сторонники указывают, что ряд ИИ-краулеров (например, GPTBot) фиксируют запросы к llms.txt в логах сервера — это косвенное подтверждение того, что файл востребован. Однако документальных гарантий от крупных вендоров нет: ни один из них не включил llms.txt в официальную спецификацию или дорожную карту.
Практический вывод: если ресурсы позволяют — разместите файл. Это дешёвое действие (один markdown-файл в корне), которое в худшем случае просто не будет прочитано. Но не стоит строить на нём единственную стратегию оптимизации под ИИ: базой остаются корректные robots.txt, clean URL и структурированные данные на страницах.
Как измерить эффект после внедрения
Прямой метрики вроде «количество цитирований из llms.txt» не существует — ни один публичный API или инструмент аналитики не показывает, какие фрагменты контента использует ИИ-агент при генерации ответа. Однако можно оценить косвенные признаки того, что файл востребован.
1. Проверка логов сервера. Если на сервере включено логирование запросов (стандартные access.log для Apache/Nginx), можно отследить обращения к файлу /llms.txt. Ищите в логах строки с User-Agent, содержащими GPTBot, ClaudeBot, PerplexityBot, Bytespider (Bytedance) или CCBot (Common Crawl). Если такие запросы есть — файл как минимум кто-то скачивает. Учтите, что некоторые краулеры могут игнорировать файл после первого прохода, поэтому проверяйте логи за период от недели до месяца после размещения.
2. Сравнение частоты краулинга страниц до и после. Если llms.txt содержит ссылки на разделы сайта, краулер может активнее переходить на них. В логах сервера сравните количество запросов от ИИ-ботов к страницам, перечисленным в файле, до и после его размещения. Рост числа таких запросов — косвенный сигнал, что файл используется как карта сайта. Но для чистоты эксперимента важно, чтобы за период сравнения не менялись robots.txt и sitemap.xml.
3. Тестирование с публичными API. Некоторые сервисы (например, Perplexity API) возвращают источники, на основе которых сгенерирован ответ. Если в списке источников нет страниц сайта, перечисленных в llms.txt, — файл мог не использоваться. Если источники совпадают со ссылками из файла — вероятно, он сработал. Метод не точный, но даёт ориентир.
Главное: не ждите прямых цифр. Эффективность llms.txt проявляется не в конверсиях, а в том, что у агента появляется более точная карта сайта, чем без файла. Проверяйте логи — это единственный достоверный способ убедиться, что файл хотя бы загружается.
Частые вопросы
- Нужно ли добавлять llms.txt на уже существующий сайт без ИИ-трафика? Если сайт не блокирует ИИ-краулеров в robots.txt и не закрыт от индексации паролем — разместить файл стоит. Он не влияет на производительность и может помочь, когда трафик от ИИ-агентов появится в будущем.
- Как часто обновлять llms.txt? При каждом изменении структуры сайта, добавлении новых разделов, изменении цен или контактов. Устаревший файл вводит агента в заблуждение. Минимальная частота — раз в квартал, если сайт статичен.
- Можно ли использовать llms.txt для управления тем, что ИИ видит на сайте? Да, но косвенно: файл обозначает приоритетные разделы, но не гарантирует, что агент проигнорирует страницы, не указанные в нём. Для точного контроля используйте robots.txt с запретом нежелательных разделов.
- Что делать, если сервер выдаёт 403 или 500 при обращении к /llms.txt? Проверьте, что файл доступен по прямому URL через браузер без авторизации. Если блокируется — добавьте исключение в правила сервера для пути /llms.txt (в конфиге nginx или в .htaccess для Apache, в зависимости от того, что использует хостинг). Убедитесь, что файл не защищён теми же правилами, что и служебные директории.
- Влияет ли llms.txt на SEO в обычных поисковых системах? Нет, это не стандарт W3C — Google, Яндекс и другие поисковые системы не учитывают llms.txt при ранжировании. Файл предназначен исключительно для ИИ-агентов и не заменяет sitemap.xml или robots.txt.
neuropush