«ИИ выбирает, кого процитировать» — на самом деле два разных процесса в зависимости от типа модели, и путать их не стоит.
Модели с браузингом: RAG
Perplexity, Bing Copilot, AI Overviews и режимы ChatGPT с доступом в интернет работают по схеме retrieval-augmented generation: на входящий запрос система сначала обращается к поисковому индексу, получает набор релевантных страниц, а затем модель генерирует ответ, опираясь на их содержимое и явно ссылаясь на источники. Здесь всё решает связка «краулер нашёл → страница попала в топ выдачи по этому запросу → модель извлекла из неё факт». Если страница не проиндексирована или технически недоступна для краулера — модель физически не может её процитировать, сколько бы качественного контента на ней ни было.
Модели без браузинга: параметрическая память
Базовый ChatGPT без включённого поиска отвечает из того, что «запомнил» во время обучения — из огромного корпуса текстов, собранного до определённой даты. Здесь решает не индексация в моменте, а присутствие бренда в текстах, которые с высокой вероятностью попали в обучающую выборку: авторитетные СМИ, Wikipedia, крупные форумы, документация, GitHub. Разовая публикация на своём сайте почти не влияет на этот тип узнавания — нужны упоминания на площадках, которые массово попадают в такие корпуса.
Что из этого следует практически
- Для моделей с браузингом — техническая доступность сайта для краулеров (включая явных ИИ-ботов: GPTBot, ClaudeBot, PerplexityBot) и попадание в поисковый индекс критичны как база.
- Для параметрической памяти — нужны публикации на внешних авторитетных площадках, а не только доработка собственного сайта.
- Оба канала работают на разных горизонтах: индексация может дать эффект за недели, обновление параметрической памяти модели — только со следующим циклом переобучения, это месяцы.
Как краулеры ИИ-моделей отличаются от обычных поисковых роботов
GPTBot, ClaudeBot и PerplexityBot не обязательно заходят на сайты с той же частотой, что и Googlebot. Google может проиндексировать новую страницу за час, а ИИ-краулер — заглянуть раз в несколько дней или недель, а на страницы без трафика и вовсе не зайти. Причина в том, что ИИ-краулеры чаще нацелены на сбор данных с уже авторитетных доменов, а не на исчерпывающее сканирование всей сети, как классические поисковики. Блокировка такого бота в robots.txt гарантированно исключает страницу из будущих ответов RAG-моделей. Но и открытый доступ не гарантирует цитирования: краулер может пропустить страницу, если на ней мало уникального контента или она технически тяжело грузится.
Разметка данных и её реальное влияние на цитирование
Структурированные данные (Schema.org/JSON-LD — Article, FAQPage, HowTo) помогают классическим поисковым системам лучше понимать содержимое страницы. Для RAG-моделей прямая польза не так очевидна: Perplexity и ChatGPT при генерации ответа опираются в первую очередь на обычный текст страницы, а не на JSON-LD в её коде. При этом разметка FAQPage может косвенно повысить шансы попадания в блок «Люди также спрашивают» или в сжатый прямой ответ поисковика — а такие блоки, в свою очередь, иногда становятся тем, что модель использует как источник. Практический вывод: разметку стоит внедрять как стандартную практику, но не как гарантированный рычаг влияния на цитирование конкретно в ChatGPT или Claude — прямых доказательств, что эти модели используют Schema.org при генерации ответа без поискового модуля, нет.
Сигналы авторитетности в глазах ИИ-моделей
Как и классические поисковики, RAG-модели (Perplexity, ChatGPT с браузингом) не цитируют все подряд проиндексированные страницы. Наблюдения за поведением этих систем показывают, что они склонны опираться на источники, которые в традиционном поиске считаются авторитетными. Однако прямых спецификаций от OpenAI или Perplexity о том, какие именно метрики (например, Domain Rating, трафик, количество ссылок) они используют, в открытом доступе нет. Это предположение, основанное на анализе ответов: чаще цитируются сайты с историей, узнаваемым брендом и хорошим индексом качества в глазах Google и Яндекса.
Для параметрической памяти (базовый ChatGPT, Claude без браузинга) авторитетность источника определяется его присутствием в обучающих корпусах. Если сайт или бренд систематически упоминается в Wikipedia, отраслевых изданиях, научных публикациях или на крупных форумах, модель с большей вероятностью «запомнит» его как релевантный. Одиночная публикация на малоизвестном домене в таком контексте практически не имеет веса. Подтверждённых данных о том, как именно OpenAI или Anthropic взвешивают разные типы источников при обучении, нет — это реконструкция по косвенным признакам.
Свежесть контента как фактор для RAG-моделей
Когда модели с браузингом получают запрос на актуальную тему (новости, курсы валют, релизы продуктов), они, как правило, отдают предпочтение недавно опубликованным страницам. Это логично: цель RAG — дать ответ, основанный на информации, релевантной по времени. Однако Perplexity и ChatGPT не раскрывают точный порог свежести. На практике мы видим, что страницы без даты публикации или с неявной датой цитируются реже, чем страницы с чёткой временной меткой. Рекомендация: если ваш контент посвящён событиям или данным, которые могут устареть, явно указывайте дату публикации и дату последнего обновления в видимой пользователю части страницы, а не только в метаданных.
Для параметрической памяти свежесть не имеет значения — модель оперирует данными, замороженными на момент последнего обучения. Поэтому новостной контент на собственном сайте практически не влияет на цитирование в базовом ChatGPT.
Отличия между ChatGPT, Claude и Gemini: наблюдаемые различия в выборе источников
Разные модели действительно ведут себя неодинаково, но внутренние алгоритмы ранжирования источников у OpenAI, Anthropic и Google не публикуются. Всё, что мы можем — фиксировать различия на уровне наблюдений, без утверждений о точных механизмах.
ChatGPT (OpenAI) — в режиме с поиском по вебу склонен цитировать источники из топа обычной поисковой выдачи, включая новостные сайты, Wikipedia и крупные корпоративные ресурсы. Базовая версия модели без поиска опирается на параметрическую память, и здесь чаще всплывают глобальные англоязычные источники, а для русскоязычного контекста — Wikipedia и крупные СМИ.
Claude (Anthropic) — в стандартном интерфейсе Claude.ai есть встроенный веб-поиск, который можно включить для конкретного запроса; без него модель отвечает из параметрической памяти. Наблюдения показывают, что Claude часто ссылается на академические, технические и документационные источники, но это может быть следствием состава его обучающих данных, а не специальной настройки поиска.
Gemini (Google) — использует поисковый индекс Google при браузинге, что логично даёт ему наиболее тесную связку с классическим SEO-ранжированием Google из всех рассмотренных моделей. Точных данных о том, из какой части выдачи Gemini чаще берёт источники, компания не публикует. Для ответов без браузинга Gemini полагается на параметрическую память, состав которой не раскрывается.
Практический вывод: для разных моделей стратегия должна учитывать специфику их индексации. Единого рецепта «попасть в ответы всех ИИ» не существует. Более надёжный путь — обеспечить техническую доступность для всех известных краулеров и последовательно наращивать присутствие на авторитетных внешних площадках.
Частые вопросы
- Можно ли отследить, цитирует ли ИИ-модель мой сайт?
Прямых инструментов для проверки цитирования конкретной страницы в ответах ChatGPT или Perplexity нет. Можно периодически вручную задавать релевантные запросы модели с браузингом и смотреть, появляется ли ссылка на ваш ресурс. Для массового анализа такой метод не подходит. - Блокировка GPTBot в robots.txt — это гарантия, что сайт не будет процитирован?
Да, для RAG-моделей, которые уважают файл robots.txt (GPTBot, ClaudeBot, PerplexityBot), это однозначное исключение. Для моделей без браузинга robots.txt не применяется, так как они используют данные, собранные до блокировки. - Поможет ли покупка ссылок с авторитетных сайтов для цитирования в ChatGPT?
Если ссылка стоит на странице, которая попадёт в обучающий корпус (например, в статье крупного СМИ), это может косвенно повлиять на параметрическую память. Для RAG-моделей ссылки как таковые не являются сигналом — модель опирается на контент страницы, а не на её ссылочный профиль. Прямых доказательств эффективности покупки ссылок для цитирования в ИИ нет. - Как часто нужно обновлять контент, чтобы его цитировали в свежих ответах Perplexity?
Perplexity и ChatGPT с браузингом предпочитают страницы с явной датой публикации, особенно по новостным запросам. Регулярное обновление старых страниц с изменением даты может помочь, но если контент не изменился, модель может проигнорировать новую дату. Чётких критериев свежести, опубликованных Perplexity, нет. - Что важнее для цитирования: уникальность контента или авторитетность домена?
Оба фактора работают в связке. Уникальный контент на малоизвестном домене может быть процитирован RAG-моделью, если он точно отвечает на запрос и страница технически доступна. Однако на практике авторитетные домены цитируются чаще. Для параметрической памяти авторитетность источника является критическим фактором. - Есть ли разница между моделями в том, как они обрабатывают мультимедиа?
На текущий момент все перечисленные модели (ChatGPT, Perplexity, Claude, Gemini) при цитировании в текстовых ответах используют преимущественно текстовое содержимое страниц. Изображения, видео и аудиофайлы не цитируются как источники, если они не имеют текстовых альтернатив (alt-текст, подписи, транскрипции). Влияние мультимедиа на ранжирование внутри модели не подтверждено.
Проверка технической доступности сайта для GPTBot, ClaudeBot и PerplexityBot, а также настройка правильного robots.txt — то, что входит в услугу технической оптимизации под ИИ-краулеры.
neuropush