Техническое SEO

Как Google обнаруживает новые URL: ссылки, Sitemap и сканирование

Узнайте, как Google обнаруживает новые URL через ссылки, sitemap, редиректы и сканирование и почему обнаружение URL ещё не означает его индексацию.

SeoNest Team2 мин чтения
Открыть содержание статьи

Как Google обнаруживает новые URL

Публикация страницы не означает автоматически, что Google знает о её существовании. Прежде чем Google сможет просканировать, понять или проиндексировать страницу, его системам обычно нужно сначала обнаружить URL этой страницы.

Google называет этот процесс обнаружением URL. Согласно документации Google, новые URL обычно находятся через ссылки на уже известные Google страницы и через отправленные sitemap-файлы. После обнаружения Googlebot может включить URL в процесс сканирования, однако сам факт обнаружения не гарантирует, что URL будет просканирован, проиндексирован или показан в результатах поиска. (developers.google.com)

Краткий ответ

Google в основном обнаруживает новые URL, переходя по ссылкам с уже известных страниц и обрабатывая sitemap-файлы, предоставленные владельцами сайтов. Googlebot также может находить URL при обработке редиректов и ссылок, создаваемых JavaScript, если такие ссылки реализованы в доступной для сканирования форме. (developers.google.com)

Важно различать следующие этапы:

Обнаружение → Сканирование → Индексация → Показ

Это отдельные процессы. Обнаруженный URL — это лишь URL, о существовании которого знает Google. Это ещё не означает, что страница проиндексирована.

Ключевые факты

МеханизмМожет помочь Google обнаружить URL?Важное ограничение
Внутренние ссылкиДаСсылка должна быть доступна для сканирования
Внешние ссылкиДаGoogle должен обнаружить страницу, содержащую ссылку
XML sitemapДаSitemap — это подсказка, а не гарантия
RSS/Atom feedДаОбычно охватывает недавний контент
RedirectДаGooglebot может обнаружить целевой URL при переходе между адресами
Ссылка, созданная JavaScriptДаВ конечном итоге она должна формировать доступную для сканирования ссылку <a href>
Запрос через Search ConsoleДа, для URL, которыми вы управляетеЗапрос сканирования не гарантирует индексацию

Google прямо указывает, что не поддерживает единый центральный реестр всех веб-страниц. Вместо этого его краулеры постоянно обнаруживают новые и обновлённые URL в интернете. (developers.google.com)

Ссылки — основной путь обнаружения

Googlebot в основном обнаруживает новые URL через ссылки, размещённые на страницах, которые уже известны Google. В документации Google приводится простой пример: страница категории или хаб ссылается на новую опубликованную статью в блоге, благодаря чему Google может обнаружить её URL. (developers.google.com)

Тот же принцип действует и для внутренних, и для внешних ссылок.

Внутренняя ссылка ведёт с одной страницы вашего сайта на другую:

<a href="/guides/technical-seo">Technical SEO Guide</a>

Внешняя ссылка с другого сайта также может сделать ваш URL доступным для обнаружения в рамках общего процесса сканирования.

Для важных страниц Google рекомендует убедиться, что каждая из них имеет ссылку хотя бы с одной другой страницы вашего сайта. (developers.google.com)

Именно поэтому архитектура сайта важна для обнаружения. Страница может корректно существовать на сервере, но оставаться труднодоступной для Google, если на неё не ведёт ни одна ссылка, которую Google способен просканировать.

Страницы без значимых внутренних ссылок обычно называют orphan pages.

INTERNAL LINK: Внутренняя перелинковка для SEO

Ссылки должны быть доступны для сканирования

Не каждый кликабельный элемент интерфейса обязательно является ссылкой, которую Google сможет надёжно обнаружить.

Google указывает, что наиболее безопасный вариант — HTML-элемент <a> с атрибутом href:

<a href="/services/seo">SEO Services</a>

Конструкции, основанные только на обработчиках JavaScript-событий, менее надёжны:

<span onclick="openPage('/services/seo')">SEO Services</span>

Google умеет выполнять JavaScript, а JavaScript может добавлять ссылки в отрендеренный DOM. Однако Google всё равно рекомендует реализовывать такие ссылки в соответствии с требованиями к crawlable links. (developers.google.com)

В приложениях с интенсивным использованием JavaScript каждый фрагмент контента, который должен отображаться как отдельный результат поиска, также должен иметь собственный URL. (developers.google.com)

INTERNAL LINK: JavaScript SEO

Sitemap помогает Google находить URL

Sitemap предоставляет Google структурированный список URL, которые вы считаете важными.

Например:

<url>
  <loc>https://example.com/blog/new-article</loc>
  <lastmod>2026-09-20</lastmod>
</url>

Google описывает sitemap как важный механизм обнаружения, особенно для крупных сайтов, недавно запущенных проектов, сайтов с небольшим количеством внешних ссылок, а также ресурсов со специализированным медиа- или новостным контентом. (developers.google.com)

Sitemap особенно полезен, если маловероятно, что страница будет быстро обнаружена через обычное сканирование ссылок.

Однако отправка sitemap не означает:

«Google обязан просканировать и проиндексировать каждый указанный здесь URL».

Google прямо описывает отправку sitemap как подсказку. Она не гарантирует, что Google загрузит, просканирует или проиндексирует каждый указанный URL. (developers.google.com)

Поэтому sitemap должен дополнять хорошую внутреннюю перелинковку, а не заменять её.

INTERNAL LINK: Что такое XML Sitemap

Обнаружение — это не сканирование

Именно это различие часто становится причиной путаницы в SEO.

Допустим, Google нашёл:

https://example.com/new-page

через внутреннюю ссылку.

На этом этапе Google может знать, что URL существует. Это обнаружение.

Позже Googlebot может запросить этот URL. Это сканирование.

Затем Google может проанализировать контент и решить, следует ли сохранять его в поисковом индексе и каким образом. Это индексация. (developers.google.com)

Упрощённо процесс выглядит так:

URL discovered
      ↓
Added to crawling process
      ↓
Googlebot fetches the URL
      ↓
Content is processed/rendered
      ↓
Google evaluates it for indexing

Не каждый URL проходит через все этапы.

Google прямо указывает, что соблюдение технических требований не гарантирует сканирование, индексацию или появление страницы в поиске. (developers.google.com)

robots.txt не скрывает URL

Распространённое заблуждение состоит в том, что блокировка URL в robots.txt не позволяет Google обнаружить его.

Это не обязательно так.

Если другая страница ссылается на заблокированный URL, Google всё равно может узнать о его существовании. Правило в robots.txt запрещает указанному краулеру загружать заблокированный ресурс, но не обязательно удаляет сам URL из известной Google информации.

Google отмечает, что заблокированный URL может даже появиться в результатах поиска без сниппета, поскольку Google не может просканировать его содержимое. (developers.google.com)

Если ваша цель — предотвратить индексацию, Google рекомендует использовать noindex, при этом оставив краулеру возможность получить доступ к странице и увидеть эту директиву. (developers.google.com)

INTERNAL LINK: robots.txt — объяснение

Что насчёт nofollow?

Ссылка вида:

<a href="/private-page" rel="nofollow">Page</a>

в общем случае сообщает Google, что не следует переходить по этой конкретной ссылке.

Однако это не гарантирует, что целевой URL останется необнаруженным. Google может найти тот же URL через другую внутреннюю ссылку, другой сайт или sitemap. (developers.google.com)

Поэтому обнаружение лучше рассматривать как процесс, происходящий во всём интернете, а не как действие, контролируемое одной конкретной ссылкой.

Search Console и отправка URL

Для небольшого количества страниц, которыми вы управляете, инструмент URL Inspection в Google Search Console можно использовать для запроса сканирования.

Для больших групп URL Google рекомендует использовать sitemap. (developers.google.com)

Повторные запросы индексации не заставят Google быстрее сканировать один и тот же URL, а запрос сканирования не гарантирует появление страницы в поисковых результатах. (developers.google.com)

Ещё одно распространённое заблуждение связано с Indexing API от Google. Это не универсальный API для отправки обычных страниц. Сейчас Google документирует его применение для страниц с JobPosting или livestream BroadcastEvent, встроенным в VideoObject. (developers.google.com)

Как улучшить обнаружение URL

Для большинства сайтов практический подход довольно прост:

  1. Назначайте каждой важной странице постоянный URL, доступный для сканирования.
  2. Добавляйте ссылки на новые страницы с уже существующих релевантных страниц.
  3. Используйте обычные ссылки <a href>.
  4. Убедитесь, что важные страницы доступны через архитектуру сайта.
  5. Поддерживайте актуальный sitemap с URL, которые Google должен находить.
  6. Обновляйте значимые значения <lastmod>, когда контент действительно меняется.
  7. Не блокируйте случайно необходимые страницы или ресурсы.
  8. Используйте Search Console для диагностики важных URL, которые не обнаруживаются или не сканируются.

Google также предупреждает, что обнаружение может происходить медленнее, если важные ссылки, доступные в desktop-версии сайта, отсутствуют в мобильной версии, поскольку Google индексирует мобильную версию страниц. (developers.google.com)

Рекомендация SeoNest

Рассматривайте внутренние ссылки как основную архитектуру обнаружения, а sitemap — как дополнительный сигнал для обнаружения URL.

В идеале новая страница должна естественным образом обнаруживаться через другую полезную страницу сайта, а не существовать только внутри sitemap. Для крупных или часто обновляемых сайтов стоит автоматизировать генерацию sitemap и следить за тем, чтобы недавно опубликованные canonical URL быстро в него попадали.

Если важная страница не появляется в Google, диагностируйте каждый этап отдельно:

Does Google know the URL?
        ↓
Can Google crawl it?
        ↓
Can Google render the content?
        ↓
Is it eligible for indexing?
        ↓
Did Google choose to index it?

Попытки решить проблему индексации постоянной повторной отправкой URL не помогут, если реальная причина связана с архитектурой сайта, crawlability, rendering, дублированием или качеством контента.

FAQ

Сколько времени Google требуется для обнаружения нового URL?

Гарантированного времени обнаружения нет. Google указывает, что после запроса сканирование может занять от нескольких дней до нескольких недель, а расписание сканирования определяется алгоритмически. (developers.google.com)

Нужен ли Google sitemap для обнаружения страниц?

Нет. Если страницы правильно связаны ссылками, Google обычно может обнаружить большинство из них через ссылки. Sitemap особенно полезен для крупных, новых, сложных сайтов или ресурсов с большим количеством медиа-контента. (developers.google.com)

Может ли Google обнаружить страницу без внутренних ссылок?

Потенциально да. Google может обнаружить URL через внешнюю ссылку, sitemap или другой источник. Но для важной страницы полагаться только на это — плохая архитектурная практика.

Гарантирует ли отправка sitemap индексацию?

Нет. Google прямо указывает, что отправка sitemap является подсказкой и не гарантирует сканирование или индексацию. (developers.google.com)

Останавливает ли robots.txt обнаружение URL?

Не обязательно. Google может знать о заблокированном URL через ссылки или другие механизмы обнаружения, даже если не может просканировать страницу. (developers.google.com)

Итог

Google не может просканировать страницу, о существовании которой он не знает.

Новые URL в основном обнаруживаются, когда Googlebot переходит по доступным для сканирования ссылкам в интернете и обрабатывает sitemap, предоставленные владельцами сайтов. После обнаружения URL начинается отдельный процесс, в рамках которого Google решает, когда и следует ли его сканировать, а затем — стоит ли индексировать полученный контент.

Для SEO практический вывод прост: публикуйте URL внутри доступной для обнаружения веб-структуры, а не просто размещайте их на сервере.

Источники

SEONEST

Нужна более сильная техническая основа?

Мы создаём production-ready сайты, где SEO, скорость и чистая разработка заложены в архитектуру с самого начала.

Обсудить проект