Google bot – czym jest i jakie są jego rodzaje?

Google bot – czym jest i jakie są jego rodzaje?
Spis treści

Całe szczęście, to nie pracownicy Google muszą godzinami przeglądać internetowe strony i dodawać je do firmowych indeksów – zajmują się tym roboty… a dokładniej Googleboty. Te web crawlery należące do giganta z Mountain View są odpowiedzialne za automatyczne przeszukiwanie odmętów internetu i zbieranie danych o napotykanych witrynach. Wszystkie pozyskane informacje służą do aktualizowania indeksu wyszukiwarki, czyli swoistej biblioteki, dzięki której użytkownicy szybko i łatwo znajdują najbardziej aktualne i trafne treści. Początkowo system działał w dość ograniczony sposób, analizując głównie proste strony HTML, jednak w miarę rozwoju technologii, Googlebot również ewoluował. Co jednak kryją za sobą ściany kodu? Co warto wiedzieć o wysłanniku z doliny krzemowej?

Jak działa Googlebot

Robot indeksujący, znany także jako crawler lub spider, teoretycznie ma za zadanie odgrywać rolę człowieka przeszukującego internet w poszukiwaniu nowych stron. Przy okazji odwiedza on także wcześniejsze adresy w poszukiwaniu zmian czy aktualizacji. Cały workflow Googlebota jest znany – każdy z kroków, jaki podejmuje, jest częścią większego, algorytmicznego procesu indeksowania.

Odkrywanie stron

Wirtualny pracownik Google rozpoczyna swoją zmianę od przeanalizowania listy adresów URL, które są mu już znane. Tworzy on ją na podstawie witryn odwiedzonych w przeszłości czy map (sitemap) zgłoszonych przez właścicieli stron. Sprawdza on nowe linki, które odkrył w zeskanowanych stronach i adresy przesłane ręcznie do Google Search Console. Podczas skanowania witryn, robot identyfikuje i dodaje do kolejki kolejne odsyłacze do kontroli (dlatego też strony z dobrą strukturą linkowania wewnętrznego i dużą liczbą odsyłaczy zwrotnych są skuteczniej indeksowanie).

Pobieranie treści i renderowanie strony

Po odnalezieniu adresu URL, stworzony przez Google bot pobiera jego zawartość (kod HTML, pliki CSS, skrypty oraz multimedia). W przypadku nowoczesnych stron, gdzie wiele treści nie jest dostępnych od razu, a ich działanie wymaga wykonania poleceń JavaScript, robot musi dodatkowo wyrenderować stronę, podobnie jak robi to użytkownik, korzystając z przeglądarki. Pozwala mu to zobaczyć faktyczny wygląd strony, co szczególnie przydaje się, gdy części witryny oparte są na frameworkach typu react.js, angular.js czy vue.js. Niektóre serwisy używające intensywnie JavaScriptu mogą mieć problem z poprawnym indeksowaniem, w sytuacji gdy Googlebot nie da rady uruchomić poleceń poprawnie. W takich przypadkach warto zastosować pre-rendering, który dostarcza komputerowi gotową wersję.

Indeksowanie treści

Po przeanalizowaniu treści strony, robot decyduje, czy dodać ją do indeksu Google. Jeśli treść zawiera wartościowe informacje, jest unikalna i nie została zablokowana przez właściciela strony (o tym później), zostanie dodana do bazy danych. Google crawler może jednak wykryć duplikaty lub rozpoznać witrynę jako niskojakościową – w tym wypadku zostanie ona zignorowana lub zindeksowana w ograniczony sposób. Bot pod uwagę bierze przede wszystkim:

  • Tytuł strony (<title>).
  • Nagłówki (<h1>, <h2>, <h3>).
  • Treść strony (słowa kluczowe i ich kontekst).
  • Obrazy i ich opisy (alt).
  • Strukturę linkowania wewnętrznego i zewnętrznego.

Nie wszystkie strony są indeksowane w całości – Google może pominąć niektóre elementy strony, jeśli uzna je za nieistotne dla wyników wyszukiwania.