Robots.txt существует с середины 1990-х и почти тридцать лет решал одну задачу: сказать поисковым роботам, куда им можно заходить. Последние два-три года у файла появилась вторая, куда более запутанная работа — управлять доступом десятка новых ботов, которые не индексируют сайт в привычном смысле, а либо обучают на нём языковые модели, либо в реальном времени ищут ответ на вопрос пользователя ChatGPT или Perplexity. Путаница возникает потому, что старые привычки («открыл всё — и ладно», «закрыл всё лишнее — и ладно») в новой ситуации работают не так, как кажется. Разберём подробно, что изменилось, какие боты сейчас реально существуют, и как настроить доступ осознанно, а не наугад.
Почему один и тот же файл теперь решает две разные задачи
Исторически robots.txt отвечал на один вопрос: «может ли этот бот вообще зайти на страницу». Googlebot, YandexBot и подобные краулеры делали с полученным контентом одно и то же — строили поисковый индекс. Решение «разрешить/запретить» было простым, потому что последствие тоже было одно: страница либо попадает в выдачу, либо нет.
С появлением AI-краулеров это разделилось на минимум два принципиально разных сценария использования контента:
- Обучение моделей (training). Бот скачивает контент, чтобы включить его в обучающий корпус будущей версии модели. Результат применения — где-то далеко в будущем, размыто, без прямой атрибуции конкретной странице.
- Живой поиск и цитирование (retrieval / grounding). Бот заходит по факту запроса пользователя прямо сейчас, находит релевantный контент и использует его для формирования ответа, часто с указанием источника.
Разница принципиальна: блокировка первого сценария не мешает вашему бренду появляться в ответах ИИ прямо сейчас — вы просто не участвуете в обучении следующей версии модели. Блокировка второго сценария убирает вас из ответов здесь и сейчас, потому что боту физически нечем воспользоваться. Проблема в том, что оба типа ботов часто принадлежат одной и той же компании, и не глядя в документацию, легко заблокировать не того, кого хотели.
Полный список актуальных AI-user-agent'ов
Ниже — боты, которые наш собственный инструмент проверки robots.txt для AI проверяет по умолчанию, плюс несколько дополнительных, которые встречаются в чужих конфигурациях и стоит знать в лицо.
| User-agent | Компания | Задача | Тип |
|---|---|---|---|
| GPTBot | OpenAI | Сбор данных для обучения будущих моделей | Обучение |
| OAI-SearchBot | OpenAI | Живой поиск внутри ChatGPT (поисковый режим) | Ретривал |
| ChatGPT-User | OpenAI | Загрузка страницы по прямому запросу пользователя в диалоге | Ретривал |
| ClaudeBot | Anthropic | Сбор данных для обучения | Обучение |
| Claude-User | Anthropic | Загрузка по запросу пользователя внутри Claude | Ретривал |
| anthropic-ai | Anthropic | Более старый/общий идентификатор краулера Anthropic | Смешанный |
| PerplexityBot | Perplexity | Индексация для поискового движка Perplexity | Ретривал |
| Perplexity-User | Perplexity | Загрузка страницы по прямому запросу пользователя | Ретривал |
| Google-Extended | Использование контента для Gemini и AI-функций отдельно от обычного поиска | Обучение | |
| Applebot-Extended | Apple | Данные для Apple Intelligence | Обучение |
| CCBot | Common Crawl | Открытый веб-архив, на котором обучается множество моделей разных компаний | Обучение |
| Bytespider | ByteDance | Сбор данных для моделей ByteDance/TikTok | Обучение |
Важная деталь, которая чаще всего приводит к ошибкам: у одной компании обычно есть несколько разных ботов с разными задачами. OpenAI — это как минимум три разных user-agent'а (GPTBot, OAI-SearchBot, ChatGPT-User), и правило «заблокировать OpenAI» одной строкой физически не существует — нужно явно перечислить каждого.
Как читать правила самостоятельно, не полагаясь только на инструмент
Синтаксис robots.txt простой, но пара тонкостей ломает интуицию новичка:
- Отсутствие правила — это разрешение. Если бот нигде не упомянут и общий блок
User-agent: *его не блокирует, доступ разрешён по умолчанию. Файла без единого правила для AI-ботов часто достаточно, чтобы формально всё было «открыто» — но случайно, а не осознанно. - Конкретное правило для бота перекрывает общее. Если есть отдельный блок
User-agent: GPTBot, он имеет приоритет надUser-agent: *именно для этого бота — общий блок для него не действует вообще, даже частично. - Allow может присутствовать без Disallow. Строка
Allow: /для конкретного бота — способ явно, документируемо разрешить доступ, даже если общий блок сайта что-то ограничивает. Это полезно, когда нужно показать, что решение осознанное, а не забытое.
Пример конфигурации, которая разрешает живой поиск, но не отдаёт контент в обучение:
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: /
Здесь три разных агента одной компании получают три разных решения — и это осознанный, а не случайный результат.
Три сценария из практики
Сценарий 1 — интернет-магазин блокирует всех ботов «для безопасности»
Частая история: при настройке защиты от парсинга цен конкурентами в robots.txt добавляют широкий блок User-agent: * с Disallow: / на разделы каталога, не задумываясь, что под тем же правилом попадают и AI-краулеры. Итог — конкуренты действительно не парсят цены скриптом, но и модель, которую спросили «где купить X», не видит карточки товара вообще. Решение — не убирать защиту целиком, а явно выделить AI-ботов живого поиска в отдельные разрешающие правила поверх общего запрета.
Сценарий 2 — издатель хочет цитирование, но не обучение
Готовы проверить свой сайт?
19-пунктный GEO-чек-лист — тот же набор рычагов, которым мы пользуемся в работе.
Смотреть чек-листМедиа и блоги, живущие с рекламы и подписки, часто хотят присутствовать в ответах ИИ (это трафик и узнаваемость), но не хотят, чтобы весь архив статей утёк в обучающий корпус бесплатно. Решение — заблокировать GPTBot, ClaudeBot, CCBot, Bytespider (обучение) и явно разрешить OAI-SearchBot, ChatGPT-User, Perplexity-User, PerplexityBot (живой поиск). Это ровно та настройка, которую наш инструмент помечает как «правильную» стратегию для этого профиля бизнеса.
Сценарий 3 — B2B-компания вообще не задумывалась об этом
Самый частый на практике случай: robots.txt не трогали с момента запуска сайта несколько лет назад, там прописаны правила только для Yandex и Googlebot, про AI-ботов — ни слова. Формально это означает «доступ разрешён всем», но по факту — неосознанное решение. Проверка занимает меньше минуты и обычно превращается либо в «всё уже неплохо, зафиксируем явно», либо в конкретный список правок.
Content-Signal — следующий уровень контроля
Robots.txt отвечает только на вопрос «пускать или нет». Более новая, ещё не до конца устоявшаяся директива Content-Signal позволяет разрешить сам доступ, но отдельно управлять тем, что можно делать с полученным контентом — индексировать для поиска, использовать как контекст для ответов или отдавать в обучение. Это логичное продолжение той же самой темы «обучение vs ретривал», только более гранулярное. Если вы уже разобрались с базовым Allow/Disallow по ботам, Content-Signal — следующий шаг.
Пошаговая инструкция по настройке
- Определите бизнес-цель: хотите ли вы участвовать в обучении моделей вообще, или только в живых ответах.
- Выпишите список ботов из таблицы выше, разделив их на «обучение» и «ретривал».
- Для каждой группы примите одно решение — не нужно решать по каждому боту отдельно, если стратегия одинаковая для всей группы.
- Пропишите явные правила, даже если решение «разрешить всё» — явное
Allow: /лучше, чем полагаться на отсутствие правила, потому что при следующем аудите сразу видно, что решение осознанное. - Проверьте результат — вручную или нашим инструментом.
- Занесите дату проверки в календарь на следующий квартал — список ботов стабильно пополняется.
Частые ошибки
- Блокировка только GPTBot без ChatGPT-User и OAI-SearchBot. Самая частая ошибка: думают, что заблокировали «OpenAI», а на деле закрыли только обучающего бота, оставив живой поиск открытым — или наоборот, в зависимости от того, какой бот был скопирован из старого гайда.
- Копирование списка ботов из статьи 2023-2024 года. Рынок движется быстро: у нескольких компаний менялись или добавлялись идентификаторы за последний год. Список, актуальный полтора года назад, сегодня может не содержать половины реально действующих ботов.
- Уверенность, что robots.txt — это защита данных. Файл управляет только новыми обходами. Если контент уже попал в обучающий датасет до того, как вы поставили блокировку, файл не может «отозвать» его оттуда.
- Отсутствие Content-Signal там, где важен явный контроль. Особенно для медиа и издателей — без директивы позиция компании по использованию контента формально нигде не задокументирована.
Как проверить свой сайт
Вставьте адрес сайта в наш инструмент проверки robots.txt для AI-краулеров — он покажет статус Allow/Disallow/не упомянут по каждому из проверяемых ботов и явно укажет, где решение выглядит неосознанным. Это первый и самый быстрый шаг любого GEO-аудита: нет смысла разбираться со схемой и контентом, пока неизвестно, может ли модель вообще дойти до сайта.
Частые вопросы
Что произойдёт, если вообще не трогать robots.txt?
Если файла нет вообще или в нём нет правил для AI-ботов, доступ разрешён по умолчанию всем перечисленным агентам. Это не обязательно плохо — но это решение, принятое случайно, а не осознанно, и стоит хотя бы явно это зафиксировать.
Может ли неправильная настройка снизить позиции в обычном поиске?
Нет, если речь только об AI-user-agent'ах — они технически не связаны с Googlebot или YandexBot. Блокировка GPTBot никак не повлияет на индексацию Google или Яндекса.
Нужно ли одинаково настраивать все страницы сайта?
Необязательно — можно ограничить доступ к отдельным разделам (например, к внутренней документации или служебным страницам), оставив открытыми коммерческие и информационные страницы. Robots.txt поддерживает правила по конкретным путям, а не только по всему сайту сразу.
Как часто нужно пересматривать конфигурацию?
Раз в квартал — разумный ориентир. Рынок AI-краулеров ещё формируется, и появление нового значимого бота с отдельным user-agent — обычное дело, а не редкость.
Стоит ли блокировать вообще всех обучающих ботов?
Это стратегическое решение, а не техническая рекомендация «по умолчанию». Некоторые компании сознательно разрешают обучение — это увеличивает шанс, что бренд в принципе окажется «известен» модели в будущих версиях. Другие считают это бесплатной передачей ценного контента и блокируют. Универсально правильного ответа нет, важно, чтобы решение было осознанным.
Что делать, если у сайта уже настроена сложная защита от ботов (WAF, Cloudflare)?
Проверьте отдельно — WAF может блокировать AI-краулеров по IP или поведенческим сигналам независимо от robots.txt, и файл в этом случае покажет «Allow», хотя фактического доступа нет. Стоит свериться с логами сервера или напрямую с настройками защитного сервиса.
Нужна помощь с внедрением?
Берём на себя аудит, robots.txt, llms.txt и Schema.org — под ключ.
Смотреть услугу
neuropush