Руководство · Документация платформ
Как проверить OAI-SearchBot и доступ ИИ-роботов через robots.txt
Как проверить, не блокирует ли сайт OAI-SearchBot и другие поисковые или ИИ-токены, чем search crawler отличается от training crawler и почему доступ робота не гарантирует появление в ChatGPT.
- Опубликовано
- Обновлено
Ограничение: материал объясняет проверяемый технический сигнал. Его наличие не гарантирует ранжирование, индексацию, цитирование или включение сайта в ответы ИИ.
robots.txt управляет обходом, а не всеми последствиями
robots.txt публикуется в корне origin и сообщает совместимым автоматизированным клиентам, какие пути им разрешено или запрещено запрашивать. Это не универсальный механизм удаления страницы из индекса: для индексирования применяются отдельные директивы, например noindex.
Для ИИ особенно важно различать user-agent токены по назначению. Один и тот же вендор может использовать отдельные токены для search/discovery, пользовательского получения страницы, использования контента в AI-ответах и training/model-use.
Что именно влияет на AI Readiness
В текущей методике критерий ai_crawler_access учитывает только search/discovery controls: OAI-SearchBot, Claude-SearchBot, Googlebot, YandexBot, PerplexityBot. Список берётся из того же crawler registry, который использует scanner, поэтому руководство и расчёт не должны расходиться.
AI-answer-use (YandexAdditional, YandexAdditionalBot), user-requested retrieval (Claude-User, Perplexity-User) и training/model-use (GPTBot, ClaudeBot, Google-Extended) показываются отдельно как политика владельца сайта и не уменьшают основной AI Readiness score.
Успешный статус означает только отсутствие явного запрета в опубликованной robots-политике для оцениваемого search/discovery токена. Он не доказывает будущий обход, индексирование, цитирование, обучение модели или выбор страницы для ответа.
Пример разделённой политики
Ниже search/discovery разрешён, а несколько model-use токенов запрещены. Это допустимая комбинация: политика поиска и политика обучения не обязаны совпадать. Перед копированием правил проверьте, соответствует ли такая политика вашим задачам.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Googlebot
Allow: /
User-agent: YandexBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Sitemap: https://example.com/sitemap.xmlПочему нельзя говорить просто «AI-бот»
OpenAI разделяет OAI-SearchBot для поискового обнаружения и GPTBot для model-use. Anthropic разделяет Claude-SearchBot, Claude-User и ClaudeBot. Googlebot управляет доступом Google Search, включая AI-функции в поиске, тогда как Google-Extended является отдельным product token и не управляет включением или ранжированием в Google Search.
Поэтому вывод «разрешил AI-бота — улучшил AI SEO» технически некорректен. Сначала определите назначение конкретного токена, затем задайте для него нужную политику и только после этого интерпретируйте результат проверки.
Типичные ошибки и проверка после изменений
После изменения robots.txt проверяйте не только текст файла, но и реальный HTTP-доступ, WAF/CDN, редиректы и индексирующие директивы. AI Web Check фиксирует наблюдаемую техническую политику, но не подменяет документацию конкретного поставщика и не обещает результат в его выдаче.
- Глобальный Disallow случайно перекрывает публичный раздел, который должен участвовать в search/discovery.
- WAF или CDN возвращает crawler’у 403 или challenge, хотя robots.txt формально разрешает путь.
- Search crawler, training crawler и user-triggered fetcher считаются одним механизмом и получают одинаковую политику без осознанной причины.
- robots.txt используют как замену noindex или как доказательство будущего индексирования.
- Правила копируют из старой статьи, не сверяя актуальное назначение токенов.