Аудит доступности сайта для ChatGPT Search: практический чек-лист
Сайт может быть полностью исправен с точки зрения Google и при этом оставаться недоступным для ChatGPT Search. Причина проста: у ChatGPT Search есть собственный краулер — OAI-SearchBot, и его можно независимо от Googlebot заблокировать через robots.txt, CDN, WAF, файрвол или систему защиты от ботов.
Согласно текущей документации OpenAI, для технической доступности сайта в поиске особенно важны два условия: разрешить OAI-SearchBot сканировать сайт и убедиться, что хостинг или CDN не блокирует трафик из опубликованных OpenAI диапазонов IP-адресов SearchBot. Выполнение этих условий делает сайт доступным для возможного появления в результатах, но не гарантирует, что ChatGPT выберет или покажет его по конкретному запросу. (help.openai.com)
Краткий ответ
Чтобы проверить сайт на техническую доступность для ChatGPT Search, убедитесь, что:
- контент доступен публично;
OAI-SearchBotне заблокирован в robots.txt;- CDN, файрвол, WAF или система защиты от ботов принимает легитимный трафик OAI-SearchBot из опубликованных OpenAI IP-диапазонов;
- страницы возвращают нормальные HTTP-ответы, а не требуют авторизации, CAPTCHA, прохождения challenge, не отвечают 403 и не блокируются rate limiting;
- управление
GPTBotне перепутано с настройкамиOAI-SearchBot.
OpenAI указывает, что размещение в результатах поиска зависит от нескольких факторов, связанных с релевантностью и надёжностью, и не гарантируется. Поэтому eligibility — это первый технический барьер, а не стратегия ранжирования. (help.openai.com)
Чек-лист доступности
| Проверка | Желаемый результат | Если проверка не пройдена |
|---|---|---|
| Публичный URL | Страница открывается без авторизации | Сделать предназначенный для публики контент доступным |
robots.txt | OAI-SearchBot может сканировать нужные пути | Исправить соответствующие правила Allow / Disallow |
| CDN / WAF | Проверенный трафик SearchBot принимается | Обновить правила для ботов или IP allowlist |
| HTTP-ответ | Обычный ответ страницы вместо 403/429/challenge | Проверить логи сервера, CDN и системы безопасности |
| Поиск и обучение | Доступ для поиска управляется через OAI-SearchBot | Не использовать GPTBot как механизм управления Search |
| Проверка после изменений | Конфигурация остаётся доступной после обновления систем | Повторно проверить логи после обновления систем OpenAI |
Проверка OAI-SearchBot
OpenAI определяет OAI-SearchBot как краулер, который используется для отображения сайтов в поисковых функциях ChatGPT. В документации прямо рекомендуется разрешать этому краулеру доступ в robots.txt и принимать запросы из опубликованных OpenAI IP-диапазонов SearchBot. (developers.openai.com)
Минимальная конфигурация:
User-agent: OAI-SearchBot
Allow: /
Если вы хотите разрешить доступ ChatGPT Search, но не хотите, чтобы сайт сканировался GPTBot для потенциального использования при обучении моделей, эти настройки можно разделить:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
OpenAI документирует эти настройки как независимые. Разрешение Search не требует разрешать GPTBot. (developers.openai.com)
Это различие важно, потому что GPTBot и OAI-SearchBot выполняют разные задачи. GPTBot связан со сканированием, данные которого могут использоваться для обучения базовых генеративных AI-моделей OpenAI. OAI-SearchBot управляет автоматическим сканированием для Search. ChatGPT-User, в свою очередь, представляет определённые посещения, инициированные пользователями, и не является краулером, определяющим возможность включения сайта в Search. (developers.openai.com)
INTERNAL LINK: Что такое OAI-SearchBot
Тщательная проверка robots.txt
Недостаточно просто найти строку OAI-SearchBot в robots.txt. Нужно проверить правила, которые фактически применяются к этому краулеру.
Robots Exclusion Protocol определяет правила для краулеров через группы user-agent и директивы Allow или Disallow для путей. Если отдельная группа для краулера отсутствует, к нему может применяться группа User-agent: *. Более специфичные правила для путей имеют приоритет над менее специфичными совпадениями. (rfc-editor.org)
Например:
User-agent: *
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Таким образом, отдельная группа OAI-SearchBot может задавать политику, отличающуюся от общих правил для краулеров.
Также убедитесь, что сам /robots.txt работает стабильно. RFC 9309 различает ситуацию, когда файл robots недоступен как таковой, и ситуацию, когда до него невозможно добраться из-за ошибок сервера или сети. Поэтому постоянная ошибка 5xx или проблема с соединением может иметь совсем другие последствия, чем простое отсутствие файла robots.txt. (rfc-editor.org)
Проверка инфраструктуры
Корректный robots.txt ещё не доказывает, что OpenAI действительно может получить страницу.
OpenAI отдельно рекомендует издателям убедиться, что хостинг или CDN принимает трафик с опубликованных IP-адресов SearchBot. Актуальные диапазоны поддерживаются в файле OpenAI searchbot.json, поэтому не стоит копировать фиксированный список IP в документацию навсегда. (help.openai.com)
Это особенно важно, если сайт использует Cloudflare, Akamai, управляемый WAF, собственные правила файрвола, rate limiting или системы защиты от ботов. OpenAI отмечает, что трафик краулеров может блокироваться ответами 403, автоматической защитой от ботов, JavaScript challenge, CAPTCHA, проверками авторизации или ограничениями частоты запросов. (help.openai.com)
Поэтому полезно проверить с сервера оба варианта:
curl -I https://example.com/page
и:
curl -A "OAI-SearchBot" -I https://example.com/page
Второй запрос может выявить правила приложения, зависящие от user-agent, но он не доказывает, что настоящий трафик OpenAI разрешён. Такой запрос не отправляется с IP-адреса OpenAI SearchBot. Реальное поведение инфраструктуры нужно подтверждать через настройки CDN/WAF и логи с учётом опубликованных OpenAI IP-диапазонов.
Диагностика проблем с доступом
| Симптом | Что измерять | Вероятная причина | Как подтвердить | Исправление |
|---|---|---|---|---|
OAI-SearchBot вообще не доходит до страниц | Логи CDN/WAF | Блокировка на edge-уровне | Проверить отклонённые события bot/IP | Разрешить проверенный трафик SearchBot |
/robots.txt запрашивается, а страницы — нет | Правила robots.txt | Ограничение crawling | Проверить применяемую группу user-agent | Исправить правила |
| Запросы получают 403 | HTTP/server logs | Файрвол или защита от ботов | Проверить security event | Изменить политику WAF |
| Запросы получают 429 | Rate-limit logs | Автоматическое ограничение частоты | Сопоставить время и трафик краулера | Настроить лимиты для легитимного бота |
| В браузере работает, у краулера — нет | Challenge/CAPTCHA | Слой проверки человека | Воспроизвести путь bot-запроса | Исключить легитимного краулера из проверки |
| Конфигурация изменена недавно | Время после изменения robots | Системы ещё не обновились | Проверить повторно позже | Дождаться обновления |
OpenAI указывает, что после обновления robots.txt системам Search может потребоваться примерно 24 часа, чтобы учесть изменения. Это операционная оценка, а не обещание, что через 24 часа страница обязательно появится в поиске. (developers.openai.com)
Доступность — не ранжирование
Успешный аудит подтверждает техническую доступность для crawling. Он не подтверждает видимость сайта.
OpenAI сообщает, что ChatGPT Search ранжирует результаты с учётом нескольких факторов, призванных помогать пользователям находить релевантную и надёжную информацию, и прямо указывает, что размещение не гарантируется. OpenAI не публиковала полный алгоритм ранжирования Search или фиксированные веса отдельных факторов. (help.openai.com)
Это означает, что некоторые часто обсуждаемые практики нельзя выдавать за формальные требования ChatGPT Search. В текущих публичных требованиях OpenAI к eligibility не указаны XML sitemap, llms.txt, schema markup, разрешение для GPTBot или специальный meta tag для «AI SEO» как обязательные условия включения в Search.
У этих технологий могут быть другие полезные применения, но без подтверждающих источников их не следует представлять как обязательные требования.
INTERNAL LINK: ChatGPT Search и традиционный поиск
Измерение реального трафика
Издатели, разрешившие OAI-SearchBot, могут также искать дополнительные признаки в аналитике. OpenAI указывает, что реферальные URL из ChatGPT автоматически содержат:
utm_source=chatgpt.com
Благодаря этому входящий трафик из ChatGPT проще отдельно отслеживать в аналитических системах. (help.openai.com)
Реферальный трафик и логи краулеров отвечают на разные вопросы. Логи показывают, может ли OpenAI получить доступ к сайту. Реферальные данные показывают, переходили ли пользователи из ChatGPT. Ни один из этих источников сам по себе не доказывает, как часто страница рассматривалась, ранжировалась, цитировалась или исключалась.
Распространённые ошибки
Одна из главных ошибок — считать доступ ChatGPT Search тем же самым, что индексирование в Google. Это разные вещи. Сайт может разрешать Googlebot и одновременно блокировать OAI-SearchBot на уровне robots.txt или инфраструктуры.
Другая распространённая ошибка — разрешить user-agent в robots.txt, но при этом оставить WAF, который незаметно блокирует тот же краулер. Возможна и обратная ситуация: сеть пропускает запрос, но robots.txt запрещает сканирование контента.
Наконец, блокировка GPTBot не означает автоматический отказ от участия в ChatGPT Search. OpenAI намеренно разделяет управление обучением и Search. (developers.openai.com)
Рекомендация SeoNest
Рассматривайте аудит как два независимых барьера:
Политика для краулера → доступ через инфраструктуру.
Сначала убедитесь, что robots.txt разрешает OAI-SearchBot. Затем проверьте, что легитимный запрос из опубликованной OpenAI инфраструктуры SearchBot действительно может получить страницу без блокировок на уровне безопасности или приложения.
Только после успешного прохождения этих проверок имеет смысл анализировать релевантность контента, авторитетность, качество страницы, ясность сущностей и другие факторы видимости. Иначе можно потратить много времени на «оптимизацию под ChatGPT», пока краулер в принципе не может стабильно получить доступ к сайту.
FAQ
Гарантирует ли разрешение OAI-SearchBot видимость в ChatGPT?
Нет. Оно обеспечивает техническую доступность для crawling и потенциального включения, но OpenAI указывает, что размещение не гарантируется. (help.openai.com)
Нужно ли разрешать GPTBot?
Не для технической доступности в ChatGPT Search. OpenAI документирует GPTBot и OAI-SearchBot как независимые механизмы управления. (developers.openai.com)
Можно ли запретить обучение, но разрешить Search?
Да. Можно разрешить OAI-SearchBot и одновременно запретить GPTBot. (developers.openai.com)
Стоит ли жёстко прописывать IP-адреса SearchBot?
Лучше использовать опубликованный OpenAI searchbot.json как источник актуальных данных, поскольку инфраструктура краулера может меняться. (openai.com)
Как быстро применяются изменения robots.txt?
OpenAI указывает, что её Search-системам может потребоваться примерно 24 часа после изменения robots.txt, чтобы учесть новую конфигурацию. (developers.openai.com)
Итог
Аудит технической доступности для ChatGPT Search — это прежде всего аудит доступа. Главный вопрос не в том, «добавили ли мы достаточно AI SEO-разметки», а в другом: может ли OAI-SearchBot с точки зрения правил и инфраструктуры получить доступ к контенту?
Проверьте robots.txt, сопоставьте актуальные IP-диапазоны OpenAI SearchBot с политиками вашей инфраструктуры, изучите ответы WAF и сервера, отдельно управляйте GPTBot и анализируйте как активность краулера, так и реферальный трафик. Когда эти базовые условия выполнены, проблема видимости в поиске становится вопросом релевантности и выбора контента, а не доступа.
Источники
- OpenAI — “Searching the web with ChatGPT.” Обновлено в августе 2026 года. Требования к eligibility, оговорка об отсутствии гарантии размещения и требования к инфраструктуре SearchBot. OpenAI: Searching the web with ChatGPT (help.openai.com)
- OpenAI — “Overview of OpenAI Crawlers.” Актуальная документация для разработчиков. Определения и управление OAI-SearchBot, GPTBot и ChatGPT-User; примечание о примерно 24 часах для обновления robots.txt. OpenAI Crawlers documentation (developers.openai.com)
- OpenAI — “Publishers and Developers – FAQ.” Обновлено в августе 2026 года. Рекомендации для издателей и отслеживание реферального трафика ChatGPT. OpenAI Publishers and Developers FAQ (help.openai.com)
- OpenAI — SearchBot published IP ranges. Актуальный машиночитаемый источник сетевых диапазонов OAI-SearchBot. OpenAI searchbot.json (openai.com)
- OpenAI — “Advertiser Guidance for Allowing OpenAI Web Crawlers.” Обновлено 20 сентября 2026 года. Практические рекомендации по диагностике краулеров, включая WAF, CDN, защиту от ботов, CAPTCHA, ответы 403 и rate limiting. OpenAI crawler troubleshooting guidance (help.openai.com)
- IETF — RFC 9309: Robots Exclusion Protocol. Сентябрь 2022 года. Стандартное определение обработки robots.txt, сопоставления user-agent, директив
Allow/Disallow, поведения доступа и кэширования. RFC 9309 (rfc-editor.org)


