AI Web Checkby noviKEY
Меню

Руководство · Документация платформ

Как проверить OAI-SearchBot и доступ ИИ-роботов через robots.txt

Как проверить, не блокирует ли сайт OAI-SearchBot и другие поисковые или ИИ-токены, чем search crawler отличается от training crawler и почему доступ робота не гарантирует появление в ChatGPT.

Опубликовано
Обновлено

Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.

robots.txt управляет обходом, а не всеми последствиями

robots.txt публикуется в корне origin и сообщает совместимым автоматизированным клиентам, какие пути им разрешено или запрещено запрашивать. Это не универсальный механизм удаления страницы из индекса: для индексирования применяются отдельные директивы, например noindex.

Для ИИ особенно важно различать user-agent токены по назначению. Один и тот же вендор может использовать отдельные токены для search/discovery, пользовательского получения страницы, использования контента в AI-ответах и training/model-use.

Что именно влияет на AI Readiness

В текущей методике критерий ai_crawler_access учитывает только search/discovery controls: OAI-SearchBot, Claude-SearchBot, Googlebot, YandexBot, PerplexityBot. Список берётся из того же crawler registry, который использует scanner, поэтому руководство и расчёт не должны расходиться.

AI-answer-use (YandexAdditional, YandexAdditionalBot), user-requested retrieval (Claude-User, Perplexity-User) и training/model-use (GPTBot, ClaudeBot, Google-Extended) показываются отдельно как политика владельца сайта и не уменьшают основной AI Readiness score.

Успешный статус означает только отсутствие явного запрета в опубликованной robots-политике для оцениваемого search/discovery токена. Он не доказывает будущий обход, индексирование, цитирование, обучение модели или выбор страницы для ответа.

Пример разделённой политики

Ниже search/discovery разрешён, а несколько model-use токенов запрещены. Это допустимая комбинация: политика поиска и политика обучения не обязаны совпадать. Перед копированием правил проверьте, соответствует ли такая политика вашим задачам.

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Googlebot
Allow: /

User-agent: YandexBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Sitemap: https://example.com/sitemap.xml

Почему нельзя говорить просто «AI-бот»

OpenAI разделяет OAI-SearchBot для поискового обнаружения и GPTBot для model-use. Anthropic разделяет Claude-SearchBot, Claude-User и ClaudeBot. Googlebot управляет доступом Google Search, включая AI-функции в поиске, тогда как Google-Extended является отдельным product token и не управляет включением или ранжированием в Google Search.

Поэтому вывод «разрешил AI-бота — улучшил AI SEO» технически некорректен. Сначала определите назначение конкретного токена, затем задайте для него нужную политику и только после этого интерпретируйте результат проверки.

Типичные ошибки и проверка после изменений

После изменения robots.txt проверяйте не только текст файла, но и реальный HTTP-доступ, WAF/CDN, редиректы и индексирующие директивы. AI Web Check фиксирует наблюдаемую техническую политику, но не подменяет документацию конкретного поставщика и не обещает результат в его выдаче.

  • Глобальный Disallow случайно перекрывает публичный раздел, который должен участвовать в search/discovery.
  • WAF или CDN возвращает crawler’у 403 или challenge, хотя robots.txt формально разрешает путь.
  • Search crawler, training crawler и user-triggered fetcher считаются одним механизмом и получают одинаковую политику без осознанной причины.
  • robots.txt используют как замену noindex или как доказательство будущего индексирования.
  • Правила копируют из старой статьи, не сверяя актуальное назначение токенов.