Как ChatGPT и Perplexity выбирают, кого цитировать — блог neuropush

Как ChatGPT и Perplexity выбирают, кого цитировать

// Содержание
  1. Модели с браузингом: RAG
  2. Модели без браузинга: параметрическая память
  3. Что из этого следует практически
  4. Как краулеры ИИ-моделей отличаются от обычных поисковых роботов
  5. Разметка данных и её реальное влияние на цитирование
  6. Сигналы авторитетности в глазах ИИ-моделей
  7. Свежесть контента как фактор для RAG-моделей
  8. Отличия между ChatGPT, Claude и Gemini: наблюдаемые различия в выборе источников
  9. Частые вопросы

«ИИ выбирает, кого процитировать» — на самом деле два разных процесса в зависимости от типа модели, и путать их не стоит.

Модели с браузингом: RAG

Perplexity, Bing Copilot, AI Overviews и режимы ChatGPT с доступом в интернет работают по схеме retrieval-augmented generation: на входящий запрос система сначала обращается к поисковому индексу, получает набор релевантных страниц, а затем модель генерирует ответ, опираясь на их содержимое и явно ссылаясь на источники. Здесь всё решает связка «краулер нашёл → страница попала в топ выдачи по этому запросу → модель извлекла из неё факт». Если страница не проиндексирована или технически недоступна для краулера — модель физически не может её процитировать, сколько бы качественного контента на ней ни было.

Модели без браузинга: параметрическая память

Базовый ChatGPT без включённого поиска отвечает из того, что «запомнил» во время обучения — из огромного корпуса текстов, собранного до определённой даты. Здесь решает не индексация в моменте, а присутствие бренда в текстах, которые с высокой вероятностью попали в обучающую выборку: авторитетные СМИ, Wikipedia, крупные форумы, документация, GitHub. Разовая публикация на своём сайте почти не влияет на этот тип узнавания — нужны упоминания на площадках, которые массово попадают в такие корпуса.

Что из этого следует практически

  • Для моделей с браузингом — техническая доступность сайта для краулеров (включая явных ИИ-ботов: GPTBot, ClaudeBot, PerplexityBot) и попадание в поисковый индекс критичны как база.
  • Для параметрической памяти — нужны публикации на внешних авторитетных площадках, а не только доработка собственного сайта.
  • Оба канала работают на разных горизонтах: индексация может дать эффект за недели, обновление параметрической памяти модели — только со следующим циклом переобучения, это месяцы.

Как краулеры ИИ-моделей отличаются от обычных поисковых роботов

GPTBot, ClaudeBot и PerplexityBot не обязательно заходят на сайты с той же частотой, что и Googlebot. Google может проиндексировать новую страницу за час, а ИИ-краулер — заглянуть раз в несколько дней или недель, а на страницы без трафика и вовсе не зайти. Причина в том, что ИИ-краулеры чаще нацелены на сбор данных с уже авторитетных доменов, а не на исчерпывающее сканирование всей сети, как классические поисковики. Блокировка такого бота в robots.txt гарантированно исключает страницу из будущих ответов RAG-моделей. Но и открытый доступ не гарантирует цитирования: краулер может пропустить страницу, если на ней мало уникального контента или она технически тяжело грузится.

Разметка данных и её реальное влияние на цитирование

Структурированные данные (Schema.org/JSON-LD — Article, FAQPage, HowTo) помогают классическим поисковым системам лучше понимать содержимое страницы. Для RAG-моделей прямая польза не так очевидна: Perplexity и ChatGPT при генерации ответа опираются в первую очередь на обычный текст страницы, а не на JSON-LD в её коде. При этом разметка FAQPage может косвенно повысить шансы попадания в блок «Люди также спрашивают» или в сжатый прямой ответ поисковика — а такие блоки, в свою очередь, иногда становятся тем, что модель использует как источник. Практический вывод: разметку стоит внедрять как стандартную практику, но не как гарантированный рычаг влияния на цитирование конкретно в ChatGPT или Claude — прямых доказательств, что эти модели используют Schema.org при генерации ответа без поискового модуля, нет.

Сигналы авторитетности в глазах ИИ-моделей

Как и классические поисковики, RAG-модели (Perplexity, ChatGPT с браузингом) не цитируют все подряд проиндексированные страницы. Наблюдения за поведением этих систем показывают, что они склонны опираться на источники, которые в традиционном поиске считаются авторитетными. Однако прямых спецификаций от OpenAI или Perplexity о том, какие именно метрики (например, Domain Rating, трафик, количество ссылок) они используют, в открытом доступе нет. Это предположение, основанное на анализе ответов: чаще цитируются сайты с историей, узнаваемым брендом и хорошим индексом качества в глазах Google и Яндекса.

Для параметрической памяти (базовый ChatGPT, Claude без браузинга) авторитетность источника определяется его присутствием в обучающих корпусах. Если сайт или бренд систематически упоминается в Wikipedia, отраслевых изданиях, научных публикациях или на крупных форумах, модель с большей вероятностью «запомнит» его как релевантный. Одиночная публикация на малоизвестном домене в таком контексте практически не имеет веса. Подтверждённых данных о том, как именно OpenAI или Anthropic взвешивают разные типы источников при обучении, нет — это реконструкция по косвенным признакам.

Свежесть контента как фактор для RAG-моделей

Когда модели с браузингом получают запрос на актуальную тему (новости, курсы валют, релизы продуктов), они, как правило, отдают предпочтение недавно опубликованным страницам. Это логично: цель RAG — дать ответ, основанный на информации, релевантной по времени. Однако Perplexity и ChatGPT не раскрывают точный порог свежести. На практике мы видим, что страницы без даты публикации или с неявной датой цитируются реже, чем страницы с чёткой временной меткой. Рекомендация: если ваш контент посвящён событиям или данным, которые могут устареть, явно указывайте дату публикации и дату последнего обновления в видимой пользователю части страницы, а не только в метаданных.

Для параметрической памяти свежесть не имеет значения — модель оперирует данными, замороженными на момент последнего обучения. Поэтому новостной контент на собственном сайте практически не влияет на цитирование в базовом ChatGPT.

Отличия между ChatGPT, Claude и Gemini: наблюдаемые различия в выборе источников

Разные модели действительно ведут себя неодинаково, но внутренние алгоритмы ранжирования источников у OpenAI, Anthropic и Google не публикуются. Всё, что мы можем — фиксировать различия на уровне наблюдений, без утверждений о точных механизмах.

ChatGPT (OpenAI) — в режиме с поиском по вебу склонен цитировать источники из топа обычной поисковой выдачи, включая новостные сайты, Wikipedia и крупные корпоративные ресурсы. Базовая версия модели без поиска опирается на параметрическую память, и здесь чаще всплывают глобальные англоязычные источники, а для русскоязычного контекста — Wikipedia и крупные СМИ.

Claude (Anthropic) — в стандартном интерфейсе Claude.ai есть встроенный веб-поиск, который можно включить для конкретного запроса; без него модель отвечает из параметрической памяти. Наблюдения показывают, что Claude часто ссылается на академические, технические и документационные источники, но это может быть следствием состава его обучающих данных, а не специальной настройки поиска.

Gemini (Google) — использует поисковый индекс Google при браузинге, что логично даёт ему наиболее тесную связку с классическим SEO-ранжированием Google из всех рассмотренных моделей. Точных данных о том, из какой части выдачи Gemini чаще берёт источники, компания не публикует. Для ответов без браузинга Gemini полагается на параметрическую память, состав которой не раскрывается.

Практический вывод: для разных моделей стратегия должна учитывать специфику их индексации. Единого рецепта «попасть в ответы всех ИИ» не существует. Более надёжный путь — обеспечить техническую доступность для всех известных краулеров и последовательно наращивать присутствие на авторитетных внешних площадках.

Частые вопросы

  • Можно ли отследить, цитирует ли ИИ-модель мой сайт?
    Прямых инструментов для проверки цитирования конкретной страницы в ответах ChatGPT или Perplexity нет. Можно периодически вручную задавать релевантные запросы модели с браузингом и смотреть, появляется ли ссылка на ваш ресурс. Для массового анализа такой метод не подходит.
  • Блокировка GPTBot в robots.txt — это гарантия, что сайт не будет процитирован?
    Да, для RAG-моделей, которые уважают файл robots.txt (GPTBot, ClaudeBot, PerplexityBot), это однозначное исключение. Для моделей без браузинга robots.txt не применяется, так как они используют данные, собранные до блокировки.
  • Поможет ли покупка ссылок с авторитетных сайтов для цитирования в ChatGPT?
    Если ссылка стоит на странице, которая попадёт в обучающий корпус (например, в статье крупного СМИ), это может косвенно повлиять на параметрическую память. Для RAG-моделей ссылки как таковые не являются сигналом — модель опирается на контент страницы, а не на её ссылочный профиль. Прямых доказательств эффективности покупки ссылок для цитирования в ИИ нет.
  • Как часто нужно обновлять контент, чтобы его цитировали в свежих ответах Perplexity?
    Perplexity и ChatGPT с браузингом предпочитают страницы с явной датой публикации, особенно по новостным запросам. Регулярное обновление старых страниц с изменением даты может помочь, но если контент не изменился, модель может проигнорировать новую дату. Чётких критериев свежести, опубликованных Perplexity, нет.
  • Что важнее для цитирования: уникальность контента или авторитетность домена?
    Оба фактора работают в связке. Уникальный контент на малоизвестном домене может быть процитирован RAG-моделью, если он точно отвечает на запрос и страница технически доступна. Однако на практике авторитетные домены цитируются чаще. Для параметрической памяти авторитетность источника является критическим фактором.
  • Есть ли разница между моделями в том, как они обрабатывают мультимедиа?
    На текущий момент все перечисленные модели (ChatGPT, Perplexity, Claude, Gemini) при цитировании в текстовых ответах используют преимущественно текстовое содержимое страниц. Изображения, видео и аудиофайлы не цитируются как источники, если они не имеют текстовых альтернатив (alt-текст, подписи, транскрипции). Влияние мультимедиа на ранжирование внутри модели не подтверждено.

Проверка технической доступности сайта для GPTBot, ClaudeBot и PerplexityBot, а также настройка правильного robots.txt — то, что входит в услугу технической оптимизации под ИИ-краулеры.

// ЧИТАТЬ ЕЩЁ

Похожие статьи

// СЛЕДУЮЩИЙ ШАГ

Хотите разобраться на примере вашего бренда?

Начните с аудита — покажем, что из этого применимо именно к вам.

Заказать аудит