AI Web Checkby noviKEY
Меню

Руководство · Стандарт или спецификация

Canonical, robots meta и X-Robots-Tag

Как разделять предпочтительный URL, разрешение обхода и запрет индексирования, чтобы сигналы не противоречили друг другу.

Опубликовано
Обновлено

Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.

Три разных задачи

rel=canonical обозначает предпочтительную версию среди дублирующих или очень близких ресурсов. robots meta задаёт индексирующие/serving-директивы для HTML-страницы. X-Robots-Tag переносит такие директивы в HTTP-заголовок и применим в том числе к не-HTML ресурсам.

Эти механизмы не взаимозаменяемы с robots.txt. Если crawler не может получить страницу из-за robots.txt, он может не увидеть noindex внутри HTML или HTTP-ответа страницы.

Что проверяет AI Web Check

Сервис проверяет абсолютный canonical итоговой страницы, robots meta и X-Robots-Tag. Явный noindex или canonical на технический/error URL рассматривается как противоречие контексту AI Readiness.

Проверка не пытается предсказать, какой canonical в итоге выберет конкретная поисковая система: она фиксирует опубликованные сайтом сигналы и очевидные конфликты.

Пример согласованной страницы

Если ресурс действительно нужно исключить из индекса, используйте noindex осознанно и убедитесь, что crawler может получить ответ и прочитать директиву. Для PDF или других не-HTML ресурсов X-Robots-Tag позволяет задать noindex на уровне HTTP.

<link rel="canonical" href="https://example.com/article">
<meta name="robots" content="index,follow,max-image-preview:large">

# HTTP response, если отдельная header-директива не нужна:
# X-Robots-Tag отсутствует

Типичные конфликты

  • canonical указывает на URL, который возвращает ошибку или постоянный redirect дальше.
  • страница одновременно публикует index в одном месте и noindex в другом.
  • robots.txt блокирует URL, а команда рассчитывает, что crawler прочитает noindex на самой странице.
  • sitemap содержит неканоническую версию, а rel=canonical указывает на другую.

Как исправлять

Определите для каждой публичной страницы одну желаемую каноническую судьбу: индексируемая canonical-страница, redirect на другую страницу или осознанно noindex-ресурс. После этого выровняйте canonical, sitemap, robots meta, X-Robots-Tag и HTTP redirects вокруг этого решения.