robots.txt: zamonaviy saytlar uchun tushuntirish
robots.txt faylidagi bitta qator crawler’ga minglab URL’larni so‘rashni taqiqlashi mumkin — yoki tasodifan siz ochiq bo‘lishini istagan sahifa va resurslarga kirishni yopib qo‘yishi mumkin.
Shu sababli robots.txt ahamiyatini kam baholash oson. U kichik konfiguratsiya fayliga o‘xshaydi, ammo ko‘plab qidiruv tizimlari, AI crawler’lar, monitoring tizimlari va boshqa avtomatlashtirilgan mijozlarning sayt bilan ishlash jarayonining eng boshida turadi.
Eng muhim farq shuki: robots.txt crawling — crawler’ning URL’larni topib, so‘rab ko‘rish jarayonini boshqaradi. U indexing’ni boshqarish vositasi, autentifikatsiya tizimi yoki xavfsizlik chegarasi emas. Google ochiqchasiga qayd etishicha, crawling uchun bloklangan URL boshqa yo‘l orqali aniqlansa, u baribir qidiruv natijalarida paydo bo‘lishi mumkin. (developers.google.com)
robots.txt nima?
robots.txt — bu qoidalarga amal qiladigan avtomatlashtirilgan crawler’larga qaysi URL yo‘llarini so‘rash mumkin yoki mumkin emasligini bildiradigan oddiy matn fayli.
Robots Exclusion Protocol 2022-yil sentabrda RFC 9309 sifatida standartlashtirilgan, garchi mexanizmning o‘zi web’ning dastlabki davrlaridan beri mavjud bo‘lsa ham. Standart crawler’lar robots.txt faylini qanday topishi, tahlil qilishi, cache’da saqlashi va qoidalarni qo‘llashi kerakligini belgilaydi. (rfc-editor.org)
HTTPS saytlar uchun fayl odatda quyidagi manzilda joylashadi:
https://example.com/robots.txt
U tegishli host’ning root qismida bo‘lishi kerak. Masalan:
https://example.com/blog/robots.txt
manzilidagi fayl example.com uchun crawling’ni boshqarmaydi. RFC 9309 bo‘yicha standart joylashuv /robots.txt, fayl nomi esa kichik harflarda yoziladi. (rfc-editor.org)
robots.txt aslida nimani boshqaradi?
robots.txt’ni sayt kirishidagi ko‘rsatma sifatida tasavvur qilish mumkin:
“Crawler X mana bu yo‘llarga kirishi mumkin, lekin boshqalariga kirmasligi kerak.”
Oddiy fayl quyidagicha ko‘rinishi mumkin:
User-agent: *
Disallow: /admin/
Disallow: /internal-search/
Sitemap: https://example.com/sitemap.xml
User-agent: * umumiy guruhga mos keladigan crawler’larga tegishli. Disallow qoidalari esa ularga ko‘rsatilgan yo‘llar bilan boshlanuvchi URL’larni so‘ramaslikni bildiradi.
Sitemap qatori uni qo‘llab-quvvatlaydigan crawler’larga XML sitemap qayerda joylashganini ko‘rsatadi. Google, Bing va boshqa yirik qidiruv tizimlari robots.txt ichida sitemap ko‘rsatilishini qo‘llab-quvvatlaydi, ammo Sitemap RFC 9309 protokolining asosiy qoidalaridan biri emas. (developers.google.com)
INTERNAL LINK: XML Sitemap nima?
Crawling va indexing bir xil emas
Bu robots.txt haqidagi eng keng tarqalgan noto‘g‘ri tushunchalardan biri.
Quyidagi misolni olaylik:
User-agent: Googlebot
Disallow: /private-offer/
Googlebot bu yo‘l ostidagi kontentni crawl qilmasligi kerak. Ammo boshqa bir sayt quyidagi URL’ga havola bersa:
https://example.com/private-offer/
Google bu URL mavjudligini baribir bilib olishi mumkin. Google hujjatlarida bloklangan URL sahifa kontenti yoki odatiy snippet’siz ham qidiruv natijalarida paydo bo‘lishi mumkinligi ko‘rsatilgan. (developers.google.com)
Agar sizning haqiqiy talabingiz:
“Bu sahifa qidiruv natijalarida ko‘rinmasligi kerak,”
bo‘lsa, indexing’ni boshqaruvchi vositadan foydalaning, masalan:
<meta name="robots" content="noindex">
yoki HTTP header:
X-Robots-Tag: noindex
Ammo bu yerda muhim bog‘liqlik bor: crawler noindex direktivasini ko‘rishi uchun avval sahifani yuklay olishi kerak. Shu sababli ayni URL’ni robots.txt orqali bloklash Google’ning noindex ko‘rsatmasini topishiga xalaqit berishi mumkin. (developers.google.com)
INTERNAL LINK: noindex va robots.txt farqi
robots.txt xavfsizlik vositasi emas
Parollar, ichki hujjatlar, mijoz ma’lumotlari, staging tizimlari, administrator sahifalari yoki maxfiy fayllarni himoyalash uchun hech qachon robots.txt’dan foydalanmang.
Bu fayl ochiq. Istalgan odam quyidagi manzilni ochishi mumkin:
https://example.com/robots.txt
va siz ko‘rsatgan yo‘llarni ko‘rishi mumkin.
RFC 9309 robots.txt kirishni avtorizatsiya qilish vositasi emasligini va haqiqiy application-level xavfsizlikni almashtirmasligi kerakligini aniq ta’kidlaydi. Maxfiy resurslar autentifikatsiya, avtorizatsiya, tarmoq cheklovlari yoki boshqa mos xavfsizlik mexanizmlari bilan himoyalanishi kerak. (rfc-editor.org)
Masalan, quyidagi qoida:
Disallow: /secret-backups/
aksincha, /secret-backups/ mavjudligini ko‘rsatib qo‘yishi mumkin.
Qoidalar qanday moslashtiriladi?
robots.txt crawler guruhlariga bo‘linadi.
Masalan:
User-agent: Googlebot
Disallow: /internal/
Allow: /internal/public/
User-agent: *
Disallow: /tmp/
Birinchi guruh Googlebot uchun. Ikkinchi guruh esa wildcard guruhiga mos keladigan boshqa crawler’lar uchun qoidalarni belgilaydi.
Google’da bir nechta qoida bitta URL’ga mos kelsa, odatda aniqroq path ustun keladi. Agar qarama-qarshi qoidalar bir xil darajada aniq bo‘lsa, Google kamroq cheklovchi qoidani qo‘llaydi. (developers.google.com)
Masalan:
User-agent: *
Disallow: /
Allow: /blog/
Bu yerda sayt umuman bloklangan, ammo /blog/ bilan boshlanuvchi URL’larga ruxsat berilgan.
Google pattern matching uchun *, URL oxirini belgilash uchun esa $ belgisini ham qo‘llab-quvvatlaydi:
User-agent: Googlebot
Disallow: /*.pdf$
Bu qoida .pdf bilan tugaydigan mos URL’larni bloklaydi. (developers.google.com)
Crawler implementatsiyalari, ayniqsa standartga kirmaydigan kengaytmalarda, farq qilishi mumkin. Shuning uchun har bir crawler Google’ga xos barcha xatti-harakatlarni qo‘llab-quvvatlaydi deb hisoblamang.
Zamonaviy JavaScript saytlari
Zamonaviy saytlar ko‘pincha ko‘rinadigan kontentni yaratish uchun JavaScript, CSS, API so‘rovlari va boshqa resurslarga tayanadi.
Agar sahifani rendering qilish uchun kerak bo‘ladigan resurslarni bloklasangiz, JavaScript rendering qiladigan crawler’lar sahifaning to‘liq bo‘lmagan versiyasini ko‘rishi mumkin. Google hujjatlariga ko‘ra, robots.txt Googlebot’ga biror URL’ni olishni taqiqlasa, u ushbu resursni so‘ramaydi; Google Search bloklangan sahifa yoki fayllardagi JavaScript’ni rendering qila olmaydi. (developers.google.com)
Shuning uchun:
Disallow: /assets/
kabi qoida, agar /assets/ ichida ochiq sahifalar uchun zarur JavaScript yoki CSS fayllari bo‘lsa, diqqat bilan tekshirilishi kerak.
Keraksiz backend yo‘llarini bloklash foydali bo‘lishi mumkin. Ammo sahifani tushunish uchun zarur resurslarni bloklash crawling yoki rendering muammolarini keltirib chiqarishi mumkin.
INTERNAL LINK: JavaScript SEO nima?
robots.txt va crawling samaradorligi
robots.txt sayt juda ko‘p crawl qilinadigan URL’larni generatsiya qila olganda ayniqsa foydali.
Bunga quyidagilar kiradi:
- faceted navigation
- ichki qidiruv natijalari
- kalendar URL’lari
- filter kombinatsiyalari
- saralash parametrlari
- session asosidagi URL’lar
- dinamik generatsiya qilinadigan URL makonlari
Masalan, e-commerce tizimi quyidagi URL’larni yaratishi mumkin:
/products?color=black&size=m&sort=price
/products?color=black&size=m&sort=newest
/products?color=black&size=l&sort=price
Minglab yoki millionlab bunday variantlar foydali qidiruv sahifalarini yaratmasdan turib crawler va server resurslarini sarflashi mumkin.
Google filtrlangan URL’larni index qilish shart bo‘lmaganda faceted navigation orqali yuzaga keladigan keraksiz crawling’ni boshqarishni alohida tavsiya qiladi. (developers.google.com)
Bu masala bir necha o‘n sahifali oddiy saytga qaraganda katta yoki juda dinamik saytlar uchun ancha muhim.
robots.txt va AI crawler’lar
Bugungi kunda robots.txt faqat an’anaviy qidiruv tizimlariga tegishli emas.
AI kompaniyalari ham crawler’lardan foydalanadi va turli crawler identity’lari turli maqsadlarni anglatishi mumkin.
Masalan, OpenAI ChatGPT qidiruv tajribalarida topilishi va ko‘rsatilishi mumkin bo‘lgan kontent uchun OAI-SearchBot’ni hujjatlashtiradi. OpenAI o‘z kontenti summaries va snippets’da mavjud bo‘lishini istagan publisher’lar OAI-SearchBot’ni bloklamasligi kerakligini bildiradi. (help.openai.com)
Anthropic ham turli faoliyatlar uchun alohida crawler identity’larini hujjatlashtiradi va botlari robots.txt direktivalariga amal qilishini bildiradi. (support.anthropic.com)
Bu zamonaviy konfiguratsiya uchun muhim savolni keltirib chiqaradi: siz aynan qaysi avtomatlashtirilgan tizimlarga kontentingizga kirishga ruxsat bermoqchisiz?
Sayt qidiruv orqali topilish, AI search retrieval, model development crawling, reklama tizimlari yoki boshqa avtomatlashtirilgan mijozlar uchun turli siyosatlarni tanlashi mumkin.
INTERNAL LINK: AI crawler’lar va robots.txt
Amaliy robots.txt misoli
Nisbatan oddiy ochiq sayt quyidagi konfiguratsiyadan foydalanishi mumkin:
User-agent: *
Disallow: /admin/
Disallow: /internal-search/
Disallow: /api/private/
Sitemap: https://example.com/sitemap.xml
Bu konfiguratsiya oddiy crawler’larni crawling uchun kam qiymatli bo‘lgan bo‘limlardan uzoqda ushlab turadi, shu bilan birga ochiq kontentni mavjud qoldiradi.
Bu misolni ko‘r-ko‘rona ko‘chirmang. Konfiguratsiya saytingizning haqiqiy arxitekturasi, crawler talablari va indexing strategiyasiga mos bo‘lishi kerak.
HTTP xatolari ham muhim
Crawler xatti-harakati /robots.txt so‘ralganda qanday javob qaytishiga ham bog‘liq.
RFC 9309 robots.txt fayli mavjud bo‘lmagan holat bilan server yoki tarmoq xatosi sabab unga ulanishning iloji bo‘lmagan holatni bir-biridan ajratadi.
Masalan, 4xx javobi fayl mavjud emas deb talqin qilinishi va crawling’ga ruxsat berilishi mumkin. Aksincha, robots.txt server yoki tarmoq muammosi tufayli olinmasa, standart crawler’lar dastlab barcha URL’lar taqiqlangan deb hisoblashini talab qiladi. Crawler’lar robots.txt’ni cache’da ham saqlashi mumkin; RFC 9309 faylga ulanish imkoni bo‘lsa, cache’dagi versiyalar odatda 24 soatdan ortiq ishlatilmasligi kerakligini aytadi. (rfc-editor.org)
Demak, robots.txt deployment’idagi nosozlik umuman robots.txt fayli bo‘lmasligidan mutlaqo boshqacha oqibatlarga olib kelishi mumkin.
RFC 9309 crawler implementatsiyalari robots.txt kontentining kamida 500 KiB qismini tahlil qila olishini ham talab qiladi. Google hozir robots.txt uchun 500 KiB limit qo‘llaydi va undan keyingi kontentni e’tiborsiz qoldiradi. (rfc-editor.org)
Oddiy robots.txt fayli odatda bunday hajmga yaqinlashmasligi kerak.
Muammolarni qanday aniqlash mumkin?
Muhim sahifalar crawl qilinmay qolsa yoki to‘g‘ri rendering bo‘lmasa, diagnostikaning dastlabki bosqichlaridayoq robots.txt’ni tekshirish kerak.
Foydali ish tartibi quyidagicha:
Belgi: sahifa yoki resurs crawl qilinmayapti.
O‘lchash: /robots.txt’ni to‘g‘ridan-to‘g‘ri so‘rang va tegishli crawler uchun qaysi qoida qo‘llanayotganini tekshiring.
Mumkin bo‘lgan sabab: juda keng Disallow, wildcard pattern, crawler’ga xos guruh yoki bloklangan rendering resursi.
Tasdiqlash: muammoli URL’ni crawler’ga mos diagnostika vositalari bilan tekshiring. Google uchun Search Console’dagi robots.txt hisobotlari va URL Inspection vositasi kirish imkoniyatini tasdiqlashga yordam beradi. (developers.google.com)
Tuzatish: noto‘g‘ri qoidani toraytiring yoki olib tashlang.
Qayta o‘lchash: URL va sahifa uchun zarur resurslarning ikkalasi ham crawl qilish uchun ochiq ekanini tekshiring.
Shuningdek, CDN, WAF, firewall, autentifikatsiya qatlami va bot-management tizimini ham tekshiring. robots.txt crawler’ga ruxsat berayotgan bo‘lishi mumkin, ammo boshqa infratuzilma qatlami baribir 403 Forbidden qaytarishi mumkin. OpenAI buni crawler access bilan bog‘liq muammolarning mumkin bo‘lgan sabablaridan biri sifatida ochiq ko‘rsatadi. (help.openai.com)
Keng tarqalgan xatolar
Eng jiddiy xatolar odatda robots.txt o‘zi mo‘ljallanmagan vazifa uchun ishlatilganda yuz beradi.
Quyidagi konfiguratsiya:
User-agent: *
Disallow: /
production saytida qoidalarga amal qiladigan umumiy crawler’larni butun saytdan bloklaydi.
Boshqa keng tarqalgan xatolarga noindex mavjud sahifalarni bloklash, rendering uchun zarur JavaScript’ni yopish, private directory nomlarini ochiq ko‘rsatish, crawl-delay barcha crawler’larda ishlaydi deb hisoblash yoki boshqa sayt qoidalarini uning arxitekturasini tushunmasdan ko‘chirib olish kiradi. Masalan, Google robots.txt’dagi crawl-delay maydonini qo‘llab-quvvatlamaydi. (developers.google.com)
robots.txt ataylab kichik va tushunarli saqlanishi kerak.
SeoNest tavsiyasi
robots.txt’ga oddiy SEO fayli sifatida emas, crawling arxitekturasining bir qismi sifatida qarang.
Aksariyat saytlar uchun avval ruxsat beruvchi konfiguratsiyadan boshlash va faqat crawler’lar haqiqatan ham so‘rashi shart bo‘lmagan URL makonlarini bloklash ma’qul. Maxfiy ma’lumotlarni haqiqiy access control mexanizmlari bilan himoyalang, maqsad ochiq sahifaning uni qo‘llab-quvvatlaydigan qidiruv tizimlari tomonidan index qilinishini oldini olish bo‘lsa noindex ishlating va qidiruv hamda AI tizimlari rivojlangan sari crawler’ga xos siyosatlarni vaqti-vaqti bilan qayta ko‘rib chiqing.
Eng muhimi, konfiguratsiya qanday ko‘rinishiga qarab taxmin qilish o‘rniga, yakuniy xatti-harakatni amalda tekshiring.
FAQ
robots.txt fayli bo‘lishi shartmi?
Yo‘q. Agar crawler’lar butun ochiq saytingizga kira olsa, robots.txt umuman bo‘lmasligi ham mumkin. Google bo‘sh fayl yoki robots.txt mavjud emasligi amalda crawling’ga standart bo‘yicha ruxsat berishini aytadi. (developers.google.com)
Disallow sahifani Google’dan olib tashlaydimi?
Yo‘q. Disallow crawling’ni boshqaradi. Bloklangan URL baribir aniqlanishi va potensial ravishda qidiruv natijalarida paydo bo‘lishi mumkin. Maqsad indexing’ni oldini olish bo‘lsa, mos noindex mexanizmidan foydalaning. (developers.google.com)
robots.txt private sahifalarni himoya qila oladimi?
Yo‘q. robots.txt hammaga ochiq va avtorizatsiya mexanizmi emas. Autentifikatsiya va tegishli access control’dan foydalaning. (rfc-editor.org)
CSS va JavaScript’ni bloklash kerakmi?
Odatda yo‘q, ayniqsa bu resurslar crawler’lar ochiq sahifalarni rendering qilishi va tushunishi uchun kerak bo‘lsa. Google robots.txt orqali bloklangan resurslardagi JavaScript’ni rendering qila olmaydi. (developers.google.com)
AI crawler’larni alohida boshqarish mumkinmi?
Ha, agar crawler operatori alohida user-agent nomlarini e’lon qilsa va robots.txt orqali boshqarishni qo‘llab-quvvatlasa. Masalan, OpenAI va Anthropic crawler’lari uchun alohida boshqaruv imkoniyatlarini hujjatlashtirgan. (help.openai.com)
Yakuniy xulosa
robots.txt tor, ammo muhim savolga javob beradi: qoidalarga amal qiladigan crawler’lar qaysi URL’larni so‘rashi mumkin?
U URL maxfiymi yoki yo‘qmi, sahifa qidiruv natijalaridan yo‘qolishi kerakmi yoki noma’lum bot serveringizga texnik jihatdan kira oladimi — bularni belgilamaydi.
Crawling, indexing, rendering, xavfsizlik va crawler identity’ni alohida masalalar sifatida ko‘ra boshlasangiz, robots.txt’ni to‘g‘ri sozlash ancha osonlashadi va undan noto‘g‘ri foydalanish ehtimoli kamayadi.
Manbalar
- IETF / RFC Editor — RFC 9309: Robots Exclusion Protocol. September 2022. (rfc-editor.org) RFC 9309
- Google Search Central — Introduction to robots.txt. Google documentation. (developers.google.com) Introduction to robots.txt
- Google Crawling Infrastructure — How Google Interprets the robots.txt Specification. Google documentation. (developers.google.com) Google robots.txt specification
- Google Crawling Infrastructure — Create and Submit a robots.txt File. Google documentation. (developers.google.com) Create a robots.txt file
- Google Search Central — Block Search Indexing with noindex. Last updated December 10, 2025. (developers.google.com) Block indexing with noindex
- Google Search Central — Understand JavaScript SEO Basics. Google documentation. (developers.google.com) JavaScript SEO basics
- Google Crawling Infrastructure — Managing Crawling of Faceted Navigation URLs. Google documentation. (developers.google.com) Faceted navigation crawling guidance
- OpenAI — Publishers and Developers FAQ. OpenAI Help Center. (help.openai.com) OpenAI publisher crawler guidance
- Anthropic — Does Anthropic Crawl Data from the Web, and How Can Site Owners Block the Crawler? Anthropic Help Center. (support.anthropic.com) Anthropic crawler guidance


