AI Web Checkby noviKEY
Меню

Руководство · Стандарт или спецификация

Sitemap и обнаружение публичных URL

Что XML Sitemap действительно сообщает автоматизированным системам и почему карта сайта не заменяет навигацию, canonical или доступность страниц.

Опубликовано
Обновлено

Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.

Что даёт sitemap.xml

Sitemap — стандартизированный список URL, которые владелец сайта предлагает crawler’ам для обнаружения. В базовом XML-протоколе обязательным для каждой записи является loc; дополнительные поля поддерживаются потребителями по-разному.

Карта сайта улучшает явность набора публичных URL, но не подтверждает качество страницы, право на индексирование, canonical-выбор или будущую цитируемость.

Что проверяет AI Web Check

Проверяется доступность базового sitemap.xml и наличие ссылки Sitemap: в robots.txt. Это два разных сигнала: сам XML-документ должен быть читаем, а robots.txt даёт стандартную точку его обнаружения.

Сервис не обходит sitemap index рекурсивно и не пытается скачать все URL из карты: цель проверки — подтвердить публичную точку discovery не создавая лишней нагрузки на сайт.

Минимальный XML

В robots.txt можно добавить отдельную строку Sitemap: https://example.com/sitemap.xml. Указывайте канонические публичные URL, а не внутренние параметры, технические страницы или редиректящие адреса.

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url><loc>https://example.com/</loc></url>
  <url><loc>https://example.com/about</loc></url>
</urlset>

Типичные ошибки

  • sitemap.xml возвращает HTML ошибки, challenge или redirect loop вместо XML.
  • В карту попадают noindex-страницы, технические URL или неканонические дубли.
  • robots.txt указывает старый или недоступный sitemap.
  • Команда ожидает, что добавление URL в sitemap само по себе гарантирует индексирование.

Как исправлять

Генерируйте карту из того же источника истины, что и публичные canonical URL. Удаляйте URL, которые не должны участвовать в discovery, и проверяйте конечный HTTP-ответ sitemap после каждого изменения инфраструктуры.

Для больших сайтов разбивайте карты по назначению и используйте sitemap index, но сохраняйте понятную связь между robots.txt, index-файлом и каноническими URL.