Руководство · Стандарт или спецификация
Sitemap и обнаружение публичных URL
Что XML Sitemap действительно сообщает автоматизированным системам и почему карта сайта не заменяет навигацию, canonical или доступность страниц.
- Опубликовано
- Обновлено
Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.
Что даёт sitemap.xml
Sitemap — стандартизированный список URL, которые владелец сайта предлагает crawler’ам для обнаружения. В базовом XML-протоколе обязательным для каждой записи является loc; дополнительные поля поддерживаются потребителями по-разному.
Карта сайта улучшает явность набора публичных URL, но не подтверждает качество страницы, право на индексирование, canonical-выбор или будущую цитируемость.
Что проверяет AI Web Check
Проверяется доступность базового sitemap.xml и наличие ссылки Sitemap: в robots.txt. Это два разных сигнала: сам XML-документ должен быть читаем, а robots.txt даёт стандартную точку его обнаружения.
Сервис не обходит sitemap index рекурсивно и не пытается скачать все URL из карты: цель проверки — подтвердить публичную точку discovery не создавая лишней нагрузки на сайт.
Минимальный XML
В robots.txt можно добавить отдельную строку Sitemap: https://example.com/sitemap.xml. Указывайте канонические публичные URL, а не внутренние параметры, технические страницы или редиректящие адреса.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url><loc>https://example.com/</loc></url>
<url><loc>https://example.com/about</loc></url>
</urlset>Типичные ошибки
- sitemap.xml возвращает HTML ошибки, challenge или redirect loop вместо XML.
- В карту попадают noindex-страницы, технические URL или неканонические дубли.
- robots.txt указывает старый или недоступный sitemap.
- Команда ожидает, что добавление URL в sitemap само по себе гарантирует индексирование.
Как исправлять
Генерируйте карту из того же источника истины, что и публичные canonical URL. Удаляйте URL, которые не должны участвовать в discovery, и проверяйте конечный HTTP-ответ sitemap после каждого изменения инфраструктуры.
Для больших сайтов разбивайте карты по назначению и используйте sitemap index, но сохраняйте понятную связь между robots.txt, index-файлом и каноническими URL.