Robots.txt для AI-краулеров: полный разбор всех ботов и сценариев — блог neuropush

Robots.txt для AI-краулеров: полный разбор всех ботов и сценариев

// Содержание
  1. Почему один и тот же файл теперь решает две разные задачи
  2. Полный список актуальных AI-user-agent'ов
  3. Как читать правила самостоятельно, не полагаясь только на инструмент
  4. Три сценария из практики
  5. Content-Signal — следующий уровень контроля
  6. Пошаговая инструкция по настройке
  7. Частые ошибки
  8. Как проверить свой сайт
  9. Частые вопросы

Robots.txt существует с середины 1990-х и почти тридцать лет решал одну задачу: сказать поисковым роботам, куда им можно заходить. Последние два-три года у файла появилась вторая, куда более запутанная работа — управлять доступом десятка новых ботов, которые не индексируют сайт в привычном смысле, а либо обучают на нём языковые модели, либо в реальном времени ищут ответ на вопрос пользователя ChatGPT или Perplexity. Путаница возникает потому, что старые привычки («открыл всё — и ладно», «закрыл всё лишнее — и ладно») в новой ситуации работают не так, как кажется. Разберём подробно, что изменилось, какие боты сейчас реально существуют, и как настроить доступ осознанно, а не наугад.

Почему один и тот же файл теперь решает две разные задачи

Исторически robots.txt отвечал на один вопрос: «может ли этот бот вообще зайти на страницу». Googlebot, YandexBot и подобные краулеры делали с полученным контентом одно и то же — строили поисковый индекс. Решение «разрешить/запретить» было простым, потому что последствие тоже было одно: страница либо попадает в выдачу, либо нет.

С появлением AI-краулеров это разделилось на минимум два принципиально разных сценария использования контента:

  • Обучение моделей (training). Бот скачивает контент, чтобы включить его в обучающий корпус будущей версии модели. Результат применения — где-то далеко в будущем, размыто, без прямой атрибуции конкретной странице.
  • Живой поиск и цитирование (retrieval / grounding). Бот заходит по факту запроса пользователя прямо сейчас, находит релевantный контент и использует его для формирования ответа, часто с указанием источника.

Разница принципиальна: блокировка первого сценария не мешает вашему бренду появляться в ответах ИИ прямо сейчас — вы просто не участвуете в обучении следующей версии модели. Блокировка второго сценария убирает вас из ответов здесь и сейчас, потому что боту физически нечем воспользоваться. Проблема в том, что оба типа ботов часто принадлежат одной и той же компании, и не глядя в документацию, легко заблокировать не того, кого хотели.

Полный список актуальных AI-user-agent'ов

Ниже — боты, которые наш собственный инструмент проверки robots.txt для AI проверяет по умолчанию, плюс несколько дополнительных, которые встречаются в чужих конфигурациях и стоит знать в лицо.

User-agentКомпанияЗадачаТип
GPTBotOpenAIСбор данных для обучения будущих моделейОбучение
OAI-SearchBotOpenAIЖивой поиск внутри ChatGPT (поисковый режим)Ретривал
ChatGPT-UserOpenAIЗагрузка страницы по прямому запросу пользователя в диалогеРетривал
ClaudeBotAnthropicСбор данных для обученияОбучение
Claude-UserAnthropicЗагрузка по запросу пользователя внутри ClaudeРетривал
anthropic-aiAnthropicБолее старый/общий идентификатор краулера AnthropicСмешанный
PerplexityBotPerplexityИндексация для поискового движка PerplexityРетривал
Perplexity-UserPerplexityЗагрузка страницы по прямому запросу пользователяРетривал
Google-ExtendedGoogleИспользование контента для Gemini и AI-функций отдельно от обычного поискаОбучение
Applebot-ExtendedAppleДанные для Apple IntelligenceОбучение
CCBotCommon CrawlОткрытый веб-архив, на котором обучается множество моделей разных компанийОбучение
BytespiderByteDanceСбор данных для моделей ByteDance/TikTokОбучение

Важная деталь, которая чаще всего приводит к ошибкам: у одной компании обычно есть несколько разных ботов с разными задачами. OpenAI — это как минимум три разных user-agent'а (GPTBot, OAI-SearchBot, ChatGPT-User), и правило «заблокировать OpenAI» одной строкой физически не существует — нужно явно перечислить каждого.

Как читать правила самостоятельно, не полагаясь только на инструмент

Синтаксис robots.txt простой, но пара тонкостей ломает интуицию новичка:

  • Отсутствие правила — это разрешение. Если бот нигде не упомянут и общий блок User-agent: * его не блокирует, доступ разрешён по умолчанию. Файла без единого правила для AI-ботов часто достаточно, чтобы формально всё было «открыто» — но случайно, а не осознанно.
  • Конкретное правило для бота перекрывает общее. Если есть отдельный блок User-agent: GPTBot, он имеет приоритет над User-agent: * именно для этого бота — общий блок для него не действует вообще, даже частично.
  • Allow может присутствовать без Disallow. Строка Allow: / для конкретного бота — способ явно, документируемо разрешить доступ, даже если общий блок сайта что-то ограничивает. Это полезно, когда нужно показать, что решение осознанное, а не забытое.

Пример конфигурации, которая разрешает живой поиск, но не отдаёт контент в обучение:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

Здесь три разных агента одной компании получают три разных решения — и это осознанный, а не случайный результат.

Три сценария из практики

Сценарий 1 — интернет-магазин блокирует всех ботов «для безопасности»

Частая история: при настройке защиты от парсинга цен конкурентами в robots.txt добавляют широкий блок User-agent: * с Disallow: / на разделы каталога, не задумываясь, что под тем же правилом попадают и AI-краулеры. Итог — конкуренты действительно не парсят цены скриптом, но и модель, которую спросили «где купить X», не видит карточки товара вообще. Решение — не убирать защиту целиком, а явно выделить AI-ботов живого поиска в отдельные разрешающие правила поверх общего запрета.

Сценарий 2 — издатель хочет цитирование, но не обучение

// ПРОВЕРЬТЕ СЕБЯ

Готовы проверить свой сайт?

19-пунктный GEO-чек-лист — тот же набор рычагов, которым мы пользуемся в работе.

Смотреть чек-лист

Медиа и блоги, живущие с рекламы и подписки, часто хотят присутствовать в ответах ИИ (это трафик и узнаваемость), но не хотят, чтобы весь архив статей утёк в обучающий корпус бесплатно. Решение — заблокировать GPTBot, ClaudeBot, CCBot, Bytespider (обучение) и явно разрешить OAI-SearchBot, ChatGPT-User, Perplexity-User, PerplexityBot (живой поиск). Это ровно та настройка, которую наш инструмент помечает как «правильную» стратегию для этого профиля бизнеса.

Сценарий 3 — B2B-компания вообще не задумывалась об этом

Самый частый на практике случай: robots.txt не трогали с момента запуска сайта несколько лет назад, там прописаны правила только для Yandex и Googlebot, про AI-ботов — ни слова. Формально это означает «доступ разрешён всем», но по факту — неосознанное решение. Проверка занимает меньше минуты и обычно превращается либо в «всё уже неплохо, зафиксируем явно», либо в конкретный список правок.

Content-Signal — следующий уровень контроля

Robots.txt отвечает только на вопрос «пускать или нет». Более новая, ещё не до конца устоявшаяся директива Content-Signal позволяет разрешить сам доступ, но отдельно управлять тем, что можно делать с полученным контентом — индексировать для поиска, использовать как контекст для ответов или отдавать в обучение. Это логичное продолжение той же самой темы «обучение vs ретривал», только более гранулярное. Если вы уже разобрались с базовым Allow/Disallow по ботам, Content-Signal — следующий шаг.

Пошаговая инструкция по настройке

  1. Определите бизнес-цель: хотите ли вы участвовать в обучении моделей вообще, или только в живых ответах.
  2. Выпишите список ботов из таблицы выше, разделив их на «обучение» и «ретривал».
  3. Для каждой группы примите одно решение — не нужно решать по каждому боту отдельно, если стратегия одинаковая для всей группы.
  4. Пропишите явные правила, даже если решение «разрешить всё» — явное Allow: / лучше, чем полагаться на отсутствие правила, потому что при следующем аудите сразу видно, что решение осознанное.
  5. Проверьте результат — вручную или нашим инструментом.
  6. Занесите дату проверки в календарь на следующий квартал — список ботов стабильно пополняется.

Частые ошибки

  • Блокировка только GPTBot без ChatGPT-User и OAI-SearchBot. Самая частая ошибка: думают, что заблокировали «OpenAI», а на деле закрыли только обучающего бота, оставив живой поиск открытым — или наоборот, в зависимости от того, какой бот был скопирован из старого гайда.
  • Копирование списка ботов из статьи 2023-2024 года. Рынок движется быстро: у нескольких компаний менялись или добавлялись идентификаторы за последний год. Список, актуальный полтора года назад, сегодня может не содержать половины реально действующих ботов.
  • Уверенность, что robots.txt — это защита данных. Файл управляет только новыми обходами. Если контент уже попал в обучающий датасет до того, как вы поставили блокировку, файл не может «отозвать» его оттуда.
  • Отсутствие Content-Signal там, где важен явный контроль. Особенно для медиа и издателей — без директивы позиция компании по использованию контента формально нигде не задокументирована.

Как проверить свой сайт

Вставьте адрес сайта в наш инструмент проверки robots.txt для AI-краулеров — он покажет статус Allow/Disallow/не упомянут по каждому из проверяемых ботов и явно укажет, где решение выглядит неосознанным. Это первый и самый быстрый шаг любого GEO-аудита: нет смысла разбираться со схемой и контентом, пока неизвестно, может ли модель вообще дойти до сайта.

Частые вопросы

Что произойдёт, если вообще не трогать robots.txt?

Если файла нет вообще или в нём нет правил для AI-ботов, доступ разрешён по умолчанию всем перечисленным агентам. Это не обязательно плохо — но это решение, принятое случайно, а не осознанно, и стоит хотя бы явно это зафиксировать.

Может ли неправильная настройка снизить позиции в обычном поиске?

Нет, если речь только об AI-user-agent'ах — они технически не связаны с Googlebot или YandexBot. Блокировка GPTBot никак не повлияет на индексацию Google или Яндекса.

Нужно ли одинаково настраивать все страницы сайта?

Необязательно — можно ограничить доступ к отдельным разделам (например, к внутренней документации или служебным страницам), оставив открытыми коммерческие и информационные страницы. Robots.txt поддерживает правила по конкретным путям, а не только по всему сайту сразу.

Как часто нужно пересматривать конфигурацию?

Раз в квартал — разумный ориентир. Рынок AI-краулеров ещё формируется, и появление нового значимого бота с отдельным user-agent — обычное дело, а не редкость.

Стоит ли блокировать вообще всех обучающих ботов?

Это стратегическое решение, а не техническая рекомендация «по умолчанию». Некоторые компании сознательно разрешают обучение — это увеличивает шанс, что бренд в принципе окажется «известен» модели в будущих версиях. Другие считают это бесплатной передачей ценного контента и блокируют. Универсально правильного ответа нет, важно, чтобы решение было осознанным.

Что делать, если у сайта уже настроена сложная защита от ботов (WAF, Cloudflare)?

Проверьте отдельно — WAF может блокировать AI-краулеров по IP или поведенческим сигналам независимо от robots.txt, и файл в этом случае покажет «Allow», хотя фактического доступа нет. Стоит свериться с логами сервера или напрямую с настройками защитного сервиса.

// ТЕХНИЧЕСКАЯ ОПТИМИЗАЦИЯ

Нужна помощь с внедрением?

Берём на себя аудит, robots.txt, llms.txt и Schema.org — под ключ.

Смотреть услугу
// ЧИТАТЬ ЕЩЁ

Похожие статьи

// СЛЕДУЮЩИЙ ШАГ

Хотите разобраться на примере вашего бренда?

Начните с аудита — покажем, что из этого применимо именно к вам.

Заказать аудит
Обсудим ваш бренд?
Введите имя
Укажите компанию или сайт
Укажите email или Telegram
Укажите телефон