AI Web Checkby noviKEY
Меню

Руководство · Документация платформ

Почему сайт не виден в ChatGPT: техническая проверка по шагам

Что проверить, если публичный сайт не появляется в поиске ChatGPT: OAI-SearchBot, robots.txt, noindex, canonical, sitemap, HTTP-доступ, JavaScript и структурированные данные.

Опубликовано
Обновлено

Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.

Сначала отделите доступность от гарантии появления

OpenAI указывает, что любой публичный сайт может появиться в поиске ChatGPT, а для включения содержимого в сводки и фрагменты важно не блокировать OAI-SearchBot. Это необходимое техническое условие для доступа к содержимому, но не обещание показа, позиции или цитирования.

Поэтому вопрос «почему сайт не виден в ChatGPT» полезно разбирать как цепочку проверяемых препятствий. Сначала подтверждается возможность получить страницу и обнаружить URL, затем проверяются индексирующие сигналы, canonical, доступность основного содержимого и машиночитаемая структура.

1. Проверьте OAI-SearchBot, robots.txt и реальный HTTP-доступ

Откройте robots.txt и проверьте правила именно для OAI-SearchBot. Глобальный Disallow, отдельный запрет для токена или ошибочная группа правил могут закрыть нужный раздел. После этого проверьте сам URL: сервер, CDN или WAF не должны отдавать 401, 403, challenge или ошибочный 5xx для публичной страницы.

Формальное Allow в robots.txt не доказывает, что ресурс доступен на сетевом уровне. И наоборот, блокировка обхода и запрет индексирования — разные механизмы, поэтому robots.txt нельзя использовать как замену noindex.

2. Найдите noindex, X-Robots-Tag и конфликтующий canonical

Проверьте meta robots в HTML и X-Robots-Tag в HTTP-заголовках. Явный noindex предназначен для исключения страницы из поисковых результатов у систем, которые поддерживают эту директиву. Чтобы робот смог увидеть noindex, страница должна быть доступна для обхода.

Затем проверьте rel=canonical. Если страница указывает каноническим другой URL, поисковая система может считать именно его представительной версией. Особенно внимательно проверяйте HTTP/HTTPS, www/non-www, параметры, языковые варианты и случайно оставленные demo-URL.

3. Убедитесь, что URL можно обнаружить

Публичная страница должна быть связана обычными ссылками с остальным сайтом и, если она важна, присутствовать в актуальном sitemap.xml. Sitemap помогает явно перечислить URL для обнаружения, но сам по себе не гарантирует индексирование.

Для нового или малоизвестного сайта отсутствие внутренних ссылок и устаревший sitemap создают простую проблему: страница технически существует, но автоматизированной системе сложнее найти её как часть связного публичного корпуса.

4. Проверьте содержимое до выполнения JavaScript

Google умеет рендерить JavaScript, но прямо отмечает, что серверный рендеринг или предварительный рендеринг остаются хорошей практикой и что не все автоматизированные клиенты выполняют JavaScript. Поэтому важный текст, заголовок, ссылки и основные метаданные полезно отдавать уже в первоначальном HTML.

Если первый ответ содержит почти пустой app shell, а смысл появляется только после нескольких клиентских запросов, доступность страницы для разных роботов становится менее предсказуемой. Это не означает, что JavaScript запрещён; проблема возникает, когда без него нельзя понять саму страницу.

5. Проверьте структуру и только потом улучшайте семантику

После устранения блокировок проверьте title, description, основной H1, понятную структуру документа и Schema.org там, где она действительно описывает сущности страницы. Структурированные данные помогают явно представить типы и свойства, но не заменяют доступный HTML и не гарантируют появление в ChatGPT.

Практический порядок такой: доступ → индексирующие директивы → canonical → обнаружение URL → содержимое HTML → структурированные данные. Если ранние звенья сломаны, косметическая доработка Schema.org не решит проблему.

Что считать результатом проверки

Даже полностью зелёная техническая проверка не доказывает, что страница будет показана или процитирована. Она означает более узкое и полезное утверждение: на проверяемом уровне не найдено известных технических препятствий для обнаружения, получения и базовой интерпретации страницы.

  • OAI-SearchBot не запрещён для нужного публичного раздела.
  • Страница отвечает корректным публичным HTTP-статусом без WAF/challenge для обычного запроса.
  • Нет неожиданного noindex или X-Robots-Tag.
  • Canonical указывает на ожидаемую публичную версию URL.
  • URL связан внутренними ссылками и при необходимости присутствует в sitemap.xml.
  • Основной смысл страницы доступен в HTML без обязательного клиентского выполнения.
  • Структурированные данные не противоречат видимому содержимому.