Čo je Crawling?

Definícia

Crawling je proces, pri ktorom vyhľadávač pomocou automatizovaného programu (crawlera alebo robota) prechádza webové stránky, sleduje odkazy medzi nimi a zbiera dáta o ich obsahu.

Popis

Crawler, napríklad Googlebot, začína na známych URL adresách a postupne prechádza odkazy, ktoré na stránke nájde. Každú novú adresu si zaznamená do fronty a neskôr ju tiež navštívi. Pri tom si všíma obsah stránky, jej štruktúru, nadpisy aj technické signály, ako je súbor robots.txt alebo hlavičky HTTP odpovede.

Nie každý web sa dá prehľadať rovnako rýchlo a dôkladne – vyhľadávače prideľujú webom takzvaný crawl budget, teda limitovaný počet stránok, ktoré v danom čase navštívia. Weby s množstvom duplicitného alebo nekvalitného obsahu tak môžu prísť o crawl budget na úkor dôležitejších stránok.

Rozdiel medzi crawlingom a indexovaním

Crawling a indexovanie sú dva nadväzujúce, no odlišné procesy. Crawling znamená, že vyhľadávač stránku objaví a navštívi, indexovanie znamená, že ju následne zaradí do svojej databázy a môže ju zobrazovať vo výsledkoch vyhľadávania. Stránka teda môže byť prehľadaná (crawled), no zároveň nemusí byť zaindexovaná – napríklad ak ju vyhľadávač vyhodnotí ako duplicitnú alebo nekvalitnú.