Директива в robots.txt: что разрешено делать с контентом — поиск, ответы или обучение модели.
Content-Signal — предлагаемое расширение robots.txt: в отличие от Allow/Disallow, которые решают только «пускать краулера или нет», эта директива описывает, что разрешено делать с уже полученным контентом — использовать в поиске, в живых ответах ИИ или для обучения моделей.
Формат: Content-Signal: search=yes, ai-input=yes, ai-train=no. search — разрешение на индексацию для обычного поиска. ai-input — разрешение использовать контент как контекст для ответов ИИ-систем (RAG, суммаризация). ai-train — разрешение включать контент в обучающие датасеты моделей. Каждый параметр — независимое yes/no.
Директива пишется внутри блока User-agent, рядом с Allow/Disallow, и может отличаться для разных ботов — например GPTBot можно ограничить по обучению, а PerplexityBot оставить с полным доступом к ai-input. Частая причина, по которой директива не срабатывает, — опечатка в названии: Content-Signals (с лишней S), content-signal без заглавных или слитное ContentSignal парсеры не распознают.
Content-Signal — развивающаяся конвенция, а не юридически обязывающий стандарт: крупные провайдеры моделей заявляют о намерении её поддерживать, но не все краулеры сегодня действительно её читают. Тем не менее раннее внедрение — явный, проверяемый сигнал вашей политики в отношении контента, который может иметь значение уже сейчас и точно не станет проблемой в будущем.
Особенно значимо для сайтов с уникальным авторским контентом, который не хочется бесплатно отдавать в обучение.
Дополняет классический robots.txt более тонким инструментом управления доступом.
Способ формально задекларировать политику использования контента ещё до появления обязательных стандартов.
Директива добавляется одной строкой — не требует изменений в инфраструктуре.
Указывайте все три параметра явно (search, ai-input, ai-train), даже если значение везде «yes» — это снимает двусмысленность.
Проверяйте точное написание — Content-Signal, а не Content-Signals или ContentSignal.
Настраивайте политику по конкретным ботам, если она различается — общее правило User-agent: * не всегда достаточно гибко.
Не считайте директиву юридической гарантией — сегодня это декларация намерений, а не принудительно соблюдаемый стандарт.
Disallow решает, может ли бот вообще зайти на страницу. Content-Signal — декларация того, что можно делать с контентом уже после того, как доступ разрешён: индексировать, использовать в ответах или обучать модель.
Формально нет — это развивающаяся, не до конца стандартизированная конвенция. Крупные провайдеры сигнализируют о готовности её поддерживать, но соблюдение сейчас не гарантировано техническими средствами.
Да, все три параметра независимы: например search=yes, ai-input=no, ai-train=yes разрешит индексацию и обучение, но запретит использование в качестве контекста для прямых ответов пользователю.
Проверьте написание строго как Content-Signal: (с заглавными C и S, без лишней буквы S в конце) и что значения — ровно yes или no, без кавычек и лишних пробелов.
Кто из 8 AI-ботов (GPTBot, ClaudeBot, PerplexityBot и другие) может заходить на ваш сайт, а кто заблокирован.
Проверить →Есть ли у сайта llms.txt и правильно ли он оформлен: заголовок, структура разделов, ссылки, MIME-тип.
Проверить →Соберём корректный по структуре llms.txt из названия сайта, описания и ссылок на ключевые разделы.
Проверить →Аудит разбирает все сигналы сразу: техническую доступность, разметку, репутацию и Entity-сигналы бренда — и даёт приоритетный план действий.
Заказать аудит