ИИ

Аудит доступности сайта для ChatGPT Search: чек-лист

Проверьте сайт на доступность для ChatGPT Search: OAI-SearchBot, robots.txt, IP-диапазоны OpenAI, CDN/WAF, HTTP-ответы и типичные блокировки краулеров.

SeoNest Team2 мин чтения
Открыть содержание статьи

Аудит доступности сайта для ChatGPT Search: практический чек-лист

Сайт может быть полностью исправен с точки зрения Google и при этом оставаться недоступным для ChatGPT Search. Причина проста: у ChatGPT Search есть собственный краулер — OAI-SearchBot, и его можно независимо от Googlebot заблокировать через robots.txt, CDN, WAF, файрвол или систему защиты от ботов.

Согласно текущей документации OpenAI, для технической доступности сайта в поиске особенно важны два условия: разрешить OAI-SearchBot сканировать сайт и убедиться, что хостинг или CDN не блокирует трафик из опубликованных OpenAI диапазонов IP-адресов SearchBot. Выполнение этих условий делает сайт доступным для возможного появления в результатах, но не гарантирует, что ChatGPT выберет или покажет его по конкретному запросу. (help.openai.com)

Краткий ответ

Чтобы проверить сайт на техническую доступность для ChatGPT Search, убедитесь, что:

  1. контент доступен публично;
  2. OAI-SearchBot не заблокирован в robots.txt;
  3. CDN, файрвол, WAF или система защиты от ботов принимает легитимный трафик OAI-SearchBot из опубликованных OpenAI IP-диапазонов;
  4. страницы возвращают нормальные HTTP-ответы, а не требуют авторизации, CAPTCHA, прохождения challenge, не отвечают 403 и не блокируются rate limiting;
  5. управление GPTBot не перепутано с настройками OAI-SearchBot.

OpenAI указывает, что размещение в результатах поиска зависит от нескольких факторов, связанных с релевантностью и надёжностью, и не гарантируется. Поэтому eligibility — это первый технический барьер, а не стратегия ранжирования. (help.openai.com)

Чек-лист доступности

ПроверкаЖелаемый результатЕсли проверка не пройдена
Публичный URLСтраница открывается без авторизацииСделать предназначенный для публики контент доступным
robots.txtOAI-SearchBot может сканировать нужные путиИсправить соответствующие правила Allow / Disallow
CDN / WAFПроверенный трафик SearchBot принимаетсяОбновить правила для ботов или IP allowlist
HTTP-ответОбычный ответ страницы вместо 403/429/challengeПроверить логи сервера, CDN и системы безопасности
Поиск и обучениеДоступ для поиска управляется через OAI-SearchBotНе использовать GPTBot как механизм управления Search
Проверка после измененийКонфигурация остаётся доступной после обновления системПовторно проверить логи после обновления систем OpenAI

Проверка OAI-SearchBot

OpenAI определяет OAI-SearchBot как краулер, который используется для отображения сайтов в поисковых функциях ChatGPT. В документации прямо рекомендуется разрешать этому краулеру доступ в robots.txt и принимать запросы из опубликованных OpenAI IP-диапазонов SearchBot. (developers.openai.com)

Минимальная конфигурация:

User-agent: OAI-SearchBot
Allow: /

Если вы хотите разрешить доступ ChatGPT Search, но не хотите, чтобы сайт сканировался GPTBot для потенциального использования при обучении моделей, эти настройки можно разделить:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

OpenAI документирует эти настройки как независимые. Разрешение Search не требует разрешать GPTBot. (developers.openai.com)

Это различие важно, потому что GPTBot и OAI-SearchBot выполняют разные задачи. GPTBot связан со сканированием, данные которого могут использоваться для обучения базовых генеративных AI-моделей OpenAI. OAI-SearchBot управляет автоматическим сканированием для Search. ChatGPT-User, в свою очередь, представляет определённые посещения, инициированные пользователями, и не является краулером, определяющим возможность включения сайта в Search. (developers.openai.com)

INTERNAL LINK: Что такое OAI-SearchBot

Тщательная проверка robots.txt

Недостаточно просто найти строку OAI-SearchBot в robots.txt. Нужно проверить правила, которые фактически применяются к этому краулеру.

Robots Exclusion Protocol определяет правила для краулеров через группы user-agent и директивы Allow или Disallow для путей. Если отдельная группа для краулера отсутствует, к нему может применяться группа User-agent: *. Более специфичные правила для путей имеют приоритет над менее специфичными совпадениями. (rfc-editor.org)

Например:

User-agent: *
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Таким образом, отдельная группа OAI-SearchBot может задавать политику, отличающуюся от общих правил для краулеров.

Также убедитесь, что сам /robots.txt работает стабильно. RFC 9309 различает ситуацию, когда файл robots недоступен как таковой, и ситуацию, когда до него невозможно добраться из-за ошибок сервера или сети. Поэтому постоянная ошибка 5xx или проблема с соединением может иметь совсем другие последствия, чем простое отсутствие файла robots.txt. (rfc-editor.org)

Проверка инфраструктуры

Корректный robots.txt ещё не доказывает, что OpenAI действительно может получить страницу.

OpenAI отдельно рекомендует издателям убедиться, что хостинг или CDN принимает трафик с опубликованных IP-адресов SearchBot. Актуальные диапазоны поддерживаются в файле OpenAI searchbot.json, поэтому не стоит копировать фиксированный список IP в документацию навсегда. (help.openai.com)

Это особенно важно, если сайт использует Cloudflare, Akamai, управляемый WAF, собственные правила файрвола, rate limiting или системы защиты от ботов. OpenAI отмечает, что трафик краулеров может блокироваться ответами 403, автоматической защитой от ботов, JavaScript challenge, CAPTCHA, проверками авторизации или ограничениями частоты запросов. (help.openai.com)

Поэтому полезно проверить с сервера оба варианта:

curl -I https://example.com/page

и:

curl -A "OAI-SearchBot" -I https://example.com/page

Второй запрос может выявить правила приложения, зависящие от user-agent, но он не доказывает, что настоящий трафик OpenAI разрешён. Такой запрос не отправляется с IP-адреса OpenAI SearchBot. Реальное поведение инфраструктуры нужно подтверждать через настройки CDN/WAF и логи с учётом опубликованных OpenAI IP-диапазонов.

Диагностика проблем с доступом

СимптомЧто измерятьВероятная причинаКак подтвердитьИсправление
OAI-SearchBot вообще не доходит до страницЛоги CDN/WAFБлокировка на edge-уровнеПроверить отклонённые события bot/IPРазрешить проверенный трафик SearchBot
/robots.txt запрашивается, а страницы — нетПравила robots.txtОграничение crawlingПроверить применяемую группу user-agentИсправить правила
Запросы получают 403HTTP/server logsФайрвол или защита от ботовПроверить security eventИзменить политику WAF
Запросы получают 429Rate-limit logsАвтоматическое ограничение частотыСопоставить время и трафик краулераНастроить лимиты для легитимного бота
В браузере работает, у краулера — нетChallenge/CAPTCHAСлой проверки человекаВоспроизвести путь bot-запросаИсключить легитимного краулера из проверки
Конфигурация изменена недавноВремя после изменения robotsСистемы ещё не обновилисьПроверить повторно позжеДождаться обновления

OpenAI указывает, что после обновления robots.txt системам Search может потребоваться примерно 24 часа, чтобы учесть изменения. Это операционная оценка, а не обещание, что через 24 часа страница обязательно появится в поиске. (developers.openai.com)

Доступность — не ранжирование

Успешный аудит подтверждает техническую доступность для crawling. Он не подтверждает видимость сайта.

OpenAI сообщает, что ChatGPT Search ранжирует результаты с учётом нескольких факторов, призванных помогать пользователям находить релевантную и надёжную информацию, и прямо указывает, что размещение не гарантируется. OpenAI не публиковала полный алгоритм ранжирования Search или фиксированные веса отдельных факторов. (help.openai.com)

Это означает, что некоторые часто обсуждаемые практики нельзя выдавать за формальные требования ChatGPT Search. В текущих публичных требованиях OpenAI к eligibility не указаны XML sitemap, llms.txt, schema markup, разрешение для GPTBot или специальный meta tag для «AI SEO» как обязательные условия включения в Search.

У этих технологий могут быть другие полезные применения, но без подтверждающих источников их не следует представлять как обязательные требования.

INTERNAL LINK: ChatGPT Search и традиционный поиск

Измерение реального трафика

Издатели, разрешившие OAI-SearchBot, могут также искать дополнительные признаки в аналитике. OpenAI указывает, что реферальные URL из ChatGPT автоматически содержат:

utm_source=chatgpt.com

Благодаря этому входящий трафик из ChatGPT проще отдельно отслеживать в аналитических системах. (help.openai.com)

Реферальный трафик и логи краулеров отвечают на разные вопросы. Логи показывают, может ли OpenAI получить доступ к сайту. Реферальные данные показывают, переходили ли пользователи из ChatGPT. Ни один из этих источников сам по себе не доказывает, как часто страница рассматривалась, ранжировалась, цитировалась или исключалась.

Распространённые ошибки

Одна из главных ошибок — считать доступ ChatGPT Search тем же самым, что индексирование в Google. Это разные вещи. Сайт может разрешать Googlebot и одновременно блокировать OAI-SearchBot на уровне robots.txt или инфраструктуры.

Другая распространённая ошибка — разрешить user-agent в robots.txt, но при этом оставить WAF, который незаметно блокирует тот же краулер. Возможна и обратная ситуация: сеть пропускает запрос, но robots.txt запрещает сканирование контента.

Наконец, блокировка GPTBot не означает автоматический отказ от участия в ChatGPT Search. OpenAI намеренно разделяет управление обучением и Search. (developers.openai.com)

Рекомендация SeoNest

Рассматривайте аудит как два независимых барьера:

Политика для краулера → доступ через инфраструктуру.

Сначала убедитесь, что robots.txt разрешает OAI-SearchBot. Затем проверьте, что легитимный запрос из опубликованной OpenAI инфраструктуры SearchBot действительно может получить страницу без блокировок на уровне безопасности или приложения.

Только после успешного прохождения этих проверок имеет смысл анализировать релевантность контента, авторитетность, качество страницы, ясность сущностей и другие факторы видимости. Иначе можно потратить много времени на «оптимизацию под ChatGPT», пока краулер в принципе не может стабильно получить доступ к сайту.

FAQ

Гарантирует ли разрешение OAI-SearchBot видимость в ChatGPT?

Нет. Оно обеспечивает техническую доступность для crawling и потенциального включения, но OpenAI указывает, что размещение не гарантируется. (help.openai.com)

Нужно ли разрешать GPTBot?

Не для технической доступности в ChatGPT Search. OpenAI документирует GPTBot и OAI-SearchBot как независимые механизмы управления. (developers.openai.com)

Да. Можно разрешить OAI-SearchBot и одновременно запретить GPTBot. (developers.openai.com)

Стоит ли жёстко прописывать IP-адреса SearchBot?

Лучше использовать опубликованный OpenAI searchbot.json как источник актуальных данных, поскольку инфраструктура краулера может меняться. (openai.com)

Как быстро применяются изменения robots.txt?

OpenAI указывает, что её Search-системам может потребоваться примерно 24 часа после изменения robots.txt, чтобы учесть новую конфигурацию. (developers.openai.com)

Итог

Аудит технической доступности для ChatGPT Search — это прежде всего аудит доступа. Главный вопрос не в том, «добавили ли мы достаточно AI SEO-разметки», а в другом: может ли OAI-SearchBot с точки зрения правил и инфраструктуры получить доступ к контенту?

Проверьте robots.txt, сопоставьте актуальные IP-диапазоны OpenAI SearchBot с политиками вашей инфраструктуры, изучите ответы WAF и сервера, отдельно управляйте GPTBot и анализируйте как активность краулера, так и реферальный трафик. Когда эти базовые условия выполнены, проблема видимости в поиске становится вопросом релевантности и выбора контента, а не доступа.

Источники

  1. OpenAI — “Searching the web with ChatGPT.” Обновлено в августе 2026 года. Требования к eligibility, оговорка об отсутствии гарантии размещения и требования к инфраструктуре SearchBot. OpenAI: Searching the web with ChatGPT (help.openai.com)
  2. OpenAI — “Overview of OpenAI Crawlers.” Актуальная документация для разработчиков. Определения и управление OAI-SearchBot, GPTBot и ChatGPT-User; примечание о примерно 24 часах для обновления robots.txt. OpenAI Crawlers documentation (developers.openai.com)
  3. OpenAI — “Publishers and Developers – FAQ.” Обновлено в августе 2026 года. Рекомендации для издателей и отслеживание реферального трафика ChatGPT. OpenAI Publishers and Developers FAQ (help.openai.com)
  4. OpenAI — SearchBot published IP ranges. Актуальный машиночитаемый источник сетевых диапазонов OAI-SearchBot. OpenAI searchbot.json (openai.com)
  5. OpenAI — “Advertiser Guidance for Allowing OpenAI Web Crawlers.” Обновлено 20 сентября 2026 года. Практические рекомендации по диагностике краулеров, включая WAF, CDN, защиту от ботов, CAPTCHA, ответы 403 и rate limiting. OpenAI crawler troubleshooting guidance (help.openai.com)
  6. IETF — RFC 9309: Robots Exclusion Protocol. Сентябрь 2022 года. Стандартное определение обработки robots.txt, сопоставления user-agent, директив Allow / Disallow, поведения доступа и кэширования. RFC 9309 (rfc-editor.org)

SEONEST

Нужна более сильная техническая основа?

Мы создаём production-ready сайты, где SEO, скорость и чистая разработка заложены в архитектуру с самого начала.

Обсудить проект