Pārmeklēšanas procesa posmi un elementi

Pārmeklēšana, zirnekļi, boti — ar šiem terminiem ikviens SEO speciālists strādā ik dienu, un tiem ir būtiska nozīme jebkurā ranžēšanas stratēģijā, jo, ja šis posms neizdodas, neizdosies arī viss pārējais.
Aplūkosim detalizēti, no kā sastāv tīmekļa pārmeklēšanas process.
Ko nozīmē pārmeklēt vietni?
Pirms turpinām, definēsim vietnes pārmeklēšanas procesu un parādīsim, cik liela nozīme tam ir jebkurā mēģinājumā parādīties Google meklēšanas rezultātos.
Vietnes pārmeklēšana tiek saprasta kā process, kurā zirnekļi jeb pārmeklētāji (crawlers) ceļo pa dažādajām vietnes lapām un vāc visu pieejamo informāciju, lai to saglabātu, apstrādātu un vēlāk klasificētu.
Vērts izcelt dažus būtiskus terminus tikko izklāstītajā definīcijā:
-
Ceļojums: Iedomājieties patiešām zirnekli. Šim draudzīgajam kukainim jāizstaigā pēc iespējas vairāk lapu, lai iegūtu pēc iespējas vairāk informācijas. Lai pārietu no vienas lapas uz otru, tas to dara caur iekšējām saitēm, kas tās savieno. No šejienes arī pareizas iekšējās saistīšanas nozīme, kas ļauj šiem zirnekļiem “atklāt” — ja ne visas — tad vismaz mums svarīgākās lapas.
-
Pieejamība: Informācijai jābūt pieejamai šiem zirnekļiem. Tas ir, ja kaut kādā veidā ierobežojam to piekļuvi apzināti vai kļūdas dēļ, mēs liegsim zirnekļiem apstrādāt visu saturu un līdz ar to to izprast un galu galā klasificēt.
Šāda lapas satura bloķēšana vai ierobežošana var notikt vairākos dažādos veidos, kurus mēģināsim izskaidrot tālāk šajā ierakstā.
Pārmeklētāji (crawlers)
Runājām par zirnekļiem, ko sauc arī par pārmeklētājiem (crawlers) vai botiem (bots). Mēs varam tos definēt kā programmas, kas analizē mūsu vietnes dokumentus, tas ir, tie ir kā “bibliotekāri”, kas meklē, klasificē un kārto. Tāpēc to galvenā funkcija ir veidot datubāzes. Ir vairāki veidi atkarībā no tā, kāda veida informāciju tie vāc. Pieminēsim dažus no izplatītākajiem.
Googlebot: Zirneklis, kas atbild par mūsu satura pārmeklēšanu un tā klasificēšanu organiskajos rezultātos (SERP). SEO speciālistiem tas ir vissvarīgākais. Jūs varat precīzi sekot, kā tas pārmeklē jūsu vietni, Google Search Console pārmeklēšanas statistikas (Crawl stats) atskaitē.
Šī veida ietvaros varam izšķirt dažus apakštipus:
-
Googlebot (viedtālruņi): Mobilā versija
-
Googlebot (datora versija): Datora versija
-
Googlebot Images: Atbild par attēlu pārmeklēšanu
-
Googlebot News: Ziņām
-
Googlebot Video: Tagad pienākusi kārta video
Mūsu žurnālos (logs) identificēta bota piemērs:
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z‡ Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
Tie nav vienīgie — ir arī citi, piemēram, Adsbot, Adsense u.c. Jau pieminot SEO nozarei aktuālos, to nošķiršana no pārējiem nav šī raksta uzmanības centrā, taču papildu informāciju atradīsiet šajā oficiālajā Google saitē.
Google pārmeklēšanas un indeksēšanas procesa posmi
Tagad, kad zinām, kas ir pārmeklēšana, kurš atbild par šo funkciju, un esam pārrunājuši procesu, aplūkosim to konkrētāk.
Pirmais posms: pārmeklēšana un klasificēšana
Process, kurā mūsu lapas parādās Google rezultātos, iziet cauri pirmajam pārmeklēšanas posmam, kā redzējām, ko veic zirnekļi (crawlers), lai tie lasītu, interpretētu, indeksētu un klasificētu mūsu saturu.
Tieši šo jauno vārdu vēlamies detalizēti analizēt — klasificēt. Google ir perfekti jāizprot mūsu saturs, vienkārši un ātri, jo, kā redzēsim vēlāk, Google mūsu vietnei velta noteiktu laika daudzumu, un šajā laikā tam jā“saprot” mūsu saturs un jāsaista tas ar dažādajiem lietotāju meklēšanas nolūkiem.
Tāpēc mūsdienu SEO tik bieži dzirdams vārds “meklēšanas nolūks” (Search Intent), jo Google to ņems vērā šajā klasificēšanā, un tas noteiks pozīciju, ko mūsu lapas ieņems SERP ranžējumos.
Tāpēc pārmeklēšanas procesam jābūt tīram, vienkāršam, ātram, bez šķēršļiem u.tml., lai viss būtu skaidrs un mūs klasificētu pareizi.
Otrais posms: indeksēšana
Nedrīkstam aizmirst indeksēšanas posmu, kas notiek pirms klasificēšanas un arī spēlē būtisku lomu, jo tas būs solis, kurā Google pievieno mūsu saturu savai datubāzei, tas ir, to indeksē.

Google robotu bloķēšana
Iepriekš pieminējām, ka ir veidi, kā mēs varētu ierobežot šo zirnekļu piekļuvi mūsu saturam. Tam ir SEO ziņā ārkārtīgi svarīgs elements, kas pazīstams kā robots.txt.
Fails robots.txt ir teksta fails, ko augšupielādējam savā serverī un kurā sniedzam precīzus norādījumus dažādajiem zirnekļiem, atļaujot vai liedzot tiem pārmeklēt mūsu vietnes URL. Šo bloķēšanu var piemērot:
-
visam domēnam
-
konkrētam ceļam
-
konkrētam URL
-
vai URL kopai, kas atbilst noteiktam šablonam.
Aplūkosim šī faila konfigurācijas piemēru:
User-agent: *
Disallow: /wp-admin/
Allow: wp-admin/admin-ajax.php
Sitemap: /sitemap.xml
Kā redzam, tajā ir pirmā rinda, kurā norādām user-agent (pārmeklētāja nosaukumu, ko vēlamies bloķēt vai atļaut, no tiem, ko redzējām iepriekš), kam seko “disallow” rīkojumi, lai aizliegtu piekļuvi, vai “allow”, lai to atļautu.
Konkrētajā gadījumā, ko redzam, norādot ar *, mēs sakām “visi pārmeklētāji” bez izņēmuma. Mēs tiem aizliedzam ieiet ceļā /wp-admin/, taču šī ceļa ietvaros vēlamies tiem atļaut ieiet /admin-ajax.php.
Nepareiza šī faila konfigurācija var novest pie tā, ka bloķējam svarīgas sava satura daļas. Bieža kļūda ir bloķēt visu vietni, kamēr tā tiek izstrādāta, un pēc tam aizmirst noņemt šo bloķēšanu pēc tās nodošanas ekspluatācijā, padarot to nepieejamu Google.
Vēl viena problēma, ar ko Google zirnekļi var saskarties, pārmeklējot mūsu saturu, ir nespēja sekot iekšējām saitēm, kas mums ir savā vietnē, un līdz ar to nepiekļūšana pārējiem URL. Tas notiek, kad šajās saitēs izmantojam javascript elementus “href” vietā. Šī prakse ir ļoti izplatīta, jo JS izmantošanai ir daudz priekšrocību lietotāja līmenī, taču, ja to izmanto nepareizi un pievieno iekšējām saitēm, Google var nespēt tām sekot.
SEO pasaulē to sauc par “saišu apslēpšanu (link obfuscation)”. Līdz pat šai dienai turpinās atklātas diskusijas par to, vai Google spēj pareizi pārmeklēt un renderēt JS veidotās lapas.
Servera atbildes kodi
Lai turpinātu labi izprast šo procesu, nedrīkstam pārlaist jēdzienu, ar ko SEO speciālistiem jāsaskaras ik dienu — servera atbildes kodus.
Iepriekš redzējām ciklu, kurā Google mūs atrod, bet kā tas notiek? Lietotājs veic meklēšanu (vaicājumu) Google. Meklētājprogramma vēršas savā datubāzē un parāda atbilstošākos rezultātus (SERP), saskaņā ar veikto klasifikāciju, šai meklēšanai.
Kad lietotājs redz dažādos rezultātus (parādīšanās reizes), viņš noklikšķina uz viena no tiem — tā, kurš, pēc viņa vērtējuma, vislabāk atbilst tam, kas viņam nepieciešams. Šajā brīdī stājas spēkā Google pieprasījums serverim, kurā mitināta vietne, lai tas “pasniegtu” saturu.
Kad tas notiek, servera atbilde tiek sniegta ar atbilstošo kodu. Nosauksim aktuālākos, kas mums kā SEO speciālistiem jāņem vērā:
-
200: Šis atbildes kods ir tas, kas Google paziņo, ka lapa eksistē, ka tai ir saturs un ka nav nekādu problēmu to parādīt. SEO speciālistiem tas ir visvēlamākais, ja vien tās lapas ar kodu 200 saturs ir optimāls.
-
30x: 30x statusa kodu saime atbilst pāradresācijām. Ievērojamākās ir 301 (pastāvīga), 302 un 307 (pagaidu). Būtībā tās Google paziņo “ei, šis URL A, ko pieprasīji, vairs nav šis, tas ir šis cits URL B”. Ir arī citas, taču tās nav izvēršamā jēdziena uzmanības centrā. Svarīgi zināt, ka SEO speciālistiem visvēlamākās ir 301, kas nodod visu autoritāti.
Ieteicamā lasāmviela: Pamācība par 301 pāradresācijām
-
40X: Kļūdu kodi. Vismazāk vēlamie SEO speciālistiem. Visizplatītākais ir slavenais 404. Kad parādās šis kods, atbildot uz Google pieprasījumu pēc URL, mēs tam paziņojam, ka tā vairs nav un ka tā līdz ar to ir kļūda.
-
410: Šo vēlējāmies izcelt no 40x saimes tā SEO vērtības dēļ. Kad izmantojam šo kodu, atbildot uz Google servera pieprasījumu pēc URL, mēs tam paziņojam, ka tas ir “pazudis uz visiem laikiem”. Tas ir interesanti, jo, atšķirībā no 404, Google saprot, ka tā tur vairs nekad nebūs, un pārtrauks mēģināt to pārmeklēt, savukārt ar 404 tas to pārmeklēs atkārtoti, domādams, ka mēs, iespējams, vēlamies to salabot.
-
50x: Šī veida atbilde ir saistīta ar servera kļūdām. Kad mūsu iekārta kāda iemesla dēļ atsakās un Google mēģina no mums pieprasīt kāda URL saturu, ja serveris atsakās, tas atgriež 505 statusa kodu.
Pārmeklēšanas budžets (Crawl Budget)
Šajā ieraksta vietā mums vēl jāaplūko termins, kas SEO pasaulē kļuva populārs pirms pāris gadiem un ir pazīstams kā pārmeklēšanas budžets (crawl budget).
Pārmeklēšanas budžets attiecas uz laiku, ko Google zirnekļi pavada, pārmeklējot vietni un visus tās URL. Tas, kā jau teicām iepriekš, ir ierobežots laiks. No šejienes arī nozīme, kāpēc jābūt optimizētai vietnei, lai šajā laikā tam būtu vieglāk ieraudzīt aktuālākās mūsu vietnes lapas.
Šis laiks, ko pārmeklētāji pavada, ejot cauri mūsu vietnei, nav fiksēta vērtība, tas pieaugs vai samazināsies atkarībā no tādiem aspektiem kā biežums, ar kādu atjauninām saturu, mūsu domēna autoritāte (popularitāte) u.tml.
Jo augstāka mūsu vietnes kvalitāte, jo lielāka autoritāte un jo vairāk svaiga satura, jo aktuālākus Google mūs uzskatīs un piešķirs vairāk budžeta mūsu pārmeklēšanai.
Ar pārmeklēšanas programmām, piemēram, Screaming Frog, mēs veicam ideāli simulētas savas vietnes pārmeklēšanas, tas ir, tā, it kā zirnekļiem būtu viss laiks pasaulē, lai izietu cauri katram mūsu URL.
Taču tā tas nedarbojas, kad runājam par Googlebot — drīzāk katru reizi, kad Google apmeklē mūsu vietni, tas dažus URL apmeklēs biežāk nekā citus. Faktiski dažus tas var pat neapmeklēt. To analizēsim ar to, kas pazīstams kā servera žurnāli (server logs) (ieraksti par to, kurus URL Google ir pārmeklējis, cik bieži tas to darījis un cik reižu noteiktā periodā).
Līdz šejienei visa analīze par to, kā izprast, kas ir pārmeklēšana, un par dažādajiem elementiem, kas veido daļu no Google pārmeklēšanas sistēmas.
Vai ir jautājumi vai ieteikumi? Kā vienmēr… mēs labprāt tos uzklausīsim!
Autors: David Kaufmann

Pēdējos 10+ gadus esmu pavadījis, pilnībā aizrāvies ar SEO — un, godīgi sakot, es to nevēlētos citādi.
Mana karjera sasniedza jaunu līmeni, kad strādāju par vecāko SEO speciālistu Chess.com — vienā no 100 visapmeklētākajām vietnēm visā internetā. Darbs šādā mērogā, aptverot miljoniem lapu, desmitiem valodu un vienu no konkurētspējīgākajām SERPs, iemācīja man to, ko neviens kurss vai sertifikāts nekad nespētu. Šī pieredze mainīja manu skatījumu uz to, kā patiesībā izskatās izcils SEO — un kļuva par pamatu visam, ko esmu izveidojis kopš tā laika.
No šīs pieredzes es nodibināju SEO Alive — aģentūru zīmoliem, kas nopietni domā par organisko izaugsmi. Mēs neesam šeit, lai pārdotu dashboards un ikmēneša atskaites. Mēs esam šeit, lai veidotu stratēģijas, kas patiešām rada rezultātus, apvienojot labāko no klasiskā SEO ar aizraujošo jauno Generative Engine Optimization (GEO) pasauli — nodrošinot, ka jūsu zīmols parādās ne tikai Google zilajās saitēs, bet arī AI ģenerētajās atbildēs, ko ChatGPT, Perplexity un Google AI Overviews katru dienu piegādā miljoniem cilvēku.
Un tā kā es nevarēju atrast rīku, kas pareizi apstrādātu abas šīs pasaules, es izveidoju to pats — SEOcrawl, enterprise SEO intelligence platformu, kas vienuviet apvieno rankings, tehniskos auditus, backlinks uzraudzību, crawl veselību un AI zīmola redzamības izsekošanu. Tā ir platforma, par kuras esamību es vienmēr biju vēlējies.
Atklājiet vairāk šī autora satura

