Кто из 8 AI-ботов (GPTBot, ClaudeBot, PerplexityBot и другие) может заходить на ваш сайт, а кто заблокирован.
Классические директивы robots.txt проектировались под поисковых ботов (Googlebot, YandexBot). У AI-компаний свои краулеры с отдельными user-agent: GPTBot, ClaudeBot, PerplexityBot, Google-Extended и другие. Если для них нет явных правил, они по умолчанию получают полный доступ — включая контент, который вы не планировали отдавать в обучение моделей.
Ключевое различие: одни боты собирают данные для обучения (GPTBot, CCBot, Bytespider), другие обслуживают запросы пользователей в реальном времени (PerplexityBot, ChatGPT-User, Google-Extended). Можно заблокировать первых и сохранить видимость во вторых — например Disallow: / для GPTBot и Allow: / для ChatGPT-User. Общее правило User-agent: * такой гибкости не даёт.
Частая ошибка — заблокировать только GPTBot, забыв про ChatGPT-User и других агентов того же поставщика с иными целями. Вторая — использовать устаревшие списки ботов: у нескольких провайдеров за последний год менялись или добавлялись user-agent. robots.txt также не убирает контент из уже собранных обучающих датасетов — он управляет только новыми обходами.
Инструмент показывает статус Allow/Disallow/не упомянут для каждого из 8 ботов. «Не упомянут» — разрешение по умолчанию, часто неосознанное. Решите стратегию: если хотите присутствовать в AI-поиске, но не отдавать контент в обучение — разрешите живые боты и заблокируйте обучающие. Дополните это директивой Content-Signal — она даёт более тонкий контроль в рамках уже разрешённого доступа.
Первый шаг GEO-аудита — прежде чем разбираться с контентом, стоит убедиться, что модели вообще могут дойти до сайта.
Полезно проверять до и после релиза, когда меняется robots.txt, WAF или CDN-конфигурация — это часто задевает ботов незаметно для команды.
Прямой ответ на вопрос «почему конкурентов упоминает ChatGPT, а нас нет» иногда звучит банально — заблокированный краулер.
Быстрая диагностика при подключении нового клиента — типовая проверка для каждого проекта.
Разделяйте правила по типу бота: обучающие (GPTBot, CCBot) и живые (PerplexityBot, ChatGPT-User) — не блокируйте всех одной директивой.
Дополняйте robots.txt директивой Content-Signal, если нужен более тонкий контроль, чем просто Allow/Disallow.
Пересматривайте список ботов не реже раза в квартал — экосистема растёт быстрее, чем обновляются шаблоны robots.txt.
Не полагайтесь на robots.txt как на барьер безопасности — если контент уже в обучающем датасете, файл не уберёт его оттуда.
Пропишите отдельные правила по user-agent: Disallow: / для GPTBot (обучение) и Allow: / для ChatGPT-User или PerplexityBot (живой поиск) — это разные боты, блокировка одного не трогает другой.
Они получат доступ по умолчанию — как любой не упомянутый бот, если общее правило User-agent: * этого явно не запрещает. Отсутствие правила — это неявное разрешение, а не блокировка.
Нет — GPTBot и Googlebot технически не связаны, у них разные user-agent и задачи. Блокировка одного не затрагивает индексацию другим.
Проверяйте раз в квартал — рынок молодой, провайдеры регулярно добавляют новых краулеров и меняют идентификаторы уже существующих.
Есть ли у сайта llms.txt и правильно ли он оформлен: заголовок, структура разделов, ссылки, MIME-тип.
Проверить →Полный дамп контента сайта для AI-ассистентов в одном файле — есть ли он и насколько полон.
Проверить →Соберём корректный по структуре llms.txt из названия сайта, описания и ссылок на ключевые разделы.
Проверить →Аудит разбирает все сигналы сразу: техническую доступность, разметку, репутацию и Entity-сигналы бренда — и даёт приоритетный план действий.
Заказать аудит