robots.txt: Išsamus konfigūravimo vadovas

Pavargote girdėti apie robots.txt ir nesuprantate, apie ką kalbama? Nesijaudinkite – šiandien pateiksime jūsų problemos sprendimą. Šiame įraše kuo aiškiau paaiškinsime, kas yra robots.txt, kaip jį sukonfigūruoti (ypač WordPress aplinkoje) ir kokį poveikį jis gali turėti mūsų projekto SEO.
Nedelskime!
Kas yra robots.txt ir kam jis skirtas?
robots.txt – tai tiesiog failas, talpinamas jūsų svetainės šakniniame kataloge, kuris leidžia neleisti tam tikriems robotams (pavyzdžiui, „Google“ ar „Bing“) lankyti jūsų svetainės ar jos dalių.
DĖMESIO: svarbu žinoti, kad tai yra protokolas, ir paprastai visi „geri“ robotai jo laikosi (GoogleBot, BingBot, Semrush, ...), tačiau bet kuris blogų ketinimų turintis robotas gali jį apeiti, pavyzdžiui, „Screaming Frog“, pažymėjus šią parinktį:

Kodėl failas robots.txt svarbus SEO?
Kaip jau minėjome, visi geri robotai (pavyzdžiui, GoogleBot) laikosi šio protokolo, todėl šį failą galime panaudoti tam, kad nukreiptume „Google“ po mūsų svetainę. Puslapiai, kuriuos čia uždrausite, „Google Search Console“ sistemoje pasirodys su žyma „Blokuota robots.txt failo“.
Ką? Kaip tai suprasti? Nukreipti „Google“ su robots.txt?
Taip, nesijaudinkite – paaiškinsime pavyzdžiu, kad viskas taptų kur kas aiškiau:
Įsivaizduokite, kad savo svetainėje turite privačią sritį, prie kurios prieigą turi tik registruoti naudotojai, o, kaip gerai žinome, „Google“ negali pasiekti jokios svetainės, kuriai reikia prisijungti (kol kas...).
Taigi, argi neverta, kad „Google“ neeikvotų mūsų nuskaitymo biudžeto (crawl budget) tiems puslapiams, kurie jam neturi jokios vertės, nuskaityti?
Būtent! Viena svarbiausių robots.txt paskirčių – blokuoti mažavertes „Google“ atžvilgiu vietas ir taip priversti jį sutelkti dėmesį į svarbius mūsų svetainės puslapius. Dėl šios priežasties robots.txt turėtų būti vienas iš mūsų SEO strategijos ramsčių.
Tai tik vienas pavyzdys iš tūkstančių dalykų, kuriuos galime nuveikti su šiuo failu. Kiti pavyzdžiai – nurodyti mūsų svetainės žemėlapį (sitemap), sumažinti nuskaitymo intervalą, blokuoti išteklių nuskaitymą, ...
Kaip sukurti robots.txt failą
Na... imkimės darbo!
Sukurti šį failą tikrai paprasta: tereikia paimti savo tekstų rengyklę („Notepad“ sistemoje „Windows“ arba „TextEdit“ sistemoje „Mac“) arba pasinaudoti internetine ir, parengus robots.txt, eksportuoti jį kaip txt failą.
Kai jį turėsime, tereikia pavadinti jį „robots.txt“ ir įkelti į savo svetainės šakninį katalogą per serverio valdymo skydelį arba per FTP.
Norėdami patikrinti, ar jis įkeltas teisingai, tiesiog prie savo domeno pridėkite „/robots.txt“, pavyzdžiui https://seocrawl.com/robots.txt
DĖMESIO: būkite atsargūs su podėliu (cache) – geriau peržiūrėkite jį inkognito režimu ;)
O jei turiu WordPress?
Jei turite WordPress, viskas dar paprasčiau, nes geriausi SEO papildiniai, tokie kaip Rank Math ar Yoast, turi integruotą įrankį robots.txt redaguoti tiesiogiai.
„Rank Math“ atveju jį rasite: Rank Math > General Settings > Edit robots.txt

„Yoast“ atveju reikės eiti į: SEO > Tools > File Editor
Taip galėsite lengvai redaguoti ar sukurti failą, nereikalaudami atlikti nė vieno iš aukščiau aprašytų veiksmų.
Komandos
Toliau apžvelgsime daugelį mums prieinamų komandų kartu su atitinkamais pavyzdžiais:
Blokuoti visos svetainės nuskaitymą
User-agent: * Disallow: /
PASTABA: jei kuriate savo svetainę ir nenorite, kad joks robotas patektų į ją, skaitytų ir indeksuotų jūsų turinį, ši taisyklė puikiai tinka.
Blokuoti puslapio nuskaitymą
User-agent: * Disallow: /puslapio-kurio-nenoriu-nuskaityti-url
Blokuoti aplanko nuskaitymą
User-agent: * Disallow: /aplankas/
Leisti prieigą prie puslapio
User-agent: * Allow: /puslapis
Blokuoti aplanką, bet leisti puslapį tame aplanke
User-agent: * Disallow: /aplankas/ Allow: /aplankas/puslapis
Nurodyti svetainės žemėlapį (sitemap)
Sitemap: https://domain.com/sitemap.xml
Duoti nurodymus konkretiems robotams
Šiuo atveju sustosime kiek ilgiau. Jei pastebėjote, dauguma ankstesnių direktyvų prasidėjo:
User-agent: *
Tas „*“ reiškia visus robotus. Tai yra, visos po tos eilutės esančios direktyvos taikomos visiems robotams. Jei norime siųsti konkrečius nurodymus tam tikriems robotams, tą reikės pakeisti taip:
User-agent: Googlebot Jei norime nurodyti „Google“ robotą
User-agent: Bingbot Jei norime nurodyti „Bing“ robotą
User-agent: DuckDuckBot Jei norime nurodyti „DuckDuckGo“ robotą
Tereikia išsiaiškinti, kaip vadinasi robotas, kuriam norite duoti nurodymą, ir pavadinti jį taip, kaip ką tik parodėme.
Peržiūrėkite ir patikrinkite robots.txt failą
Dabar, kai baigėte „derinti“ savo robots, kad jis būtų visiškai optimizuotas ir pritaikytas jūsų svetainei, belieka jį išbandyti.
Išbandyti? Kam?
Na, išbandyti tam, kad įsitikintume, jog niekur nesuklydome, ir kad jis iš tikrųjų veikia bei blokuoja tas svetainės dalis, kurias norime blokuoti.
Tam rekomenduojame naudoti šį įrankį.

Kai būsite viduje, tereikia:
-
Įvesti URL, kurio norite patikrinti, ar leidžiamas nuskaitymas
-
Pasirinkti User Agent
-
Spustelėti TEST
Iškart po to bus įkeltas visas mūsų robots.txt failas, o po juo bus nurodyta, ar prieiga leidžiama, ar ne.

Šiuo atveju, kaip matome, jis pateikia teigiamą rezultatą, tačiau jei įvestume neleidžiamą URL, jis taip pat paryškintų eilutę, kuri jį blokuoja:

Be to, šis įrankis leidžia mums redaguoti robots.txt failą tiesiogiai iš ten ir atlikti bet kokius reikiamus pakeitimus, kad rezultatas atitiktų mūsų tikslą. Kai pakeisite ir išbandysite, tereikia pritaikyti tuos naujus pakeitimus savo robots.
Papildomas patarimas: padarykite savo robots.txt nepamirštamą
Parodėme jums daugybę kodo eilučių, kurios veikia robotams, tačiau galite įterpti ir komentarus, pradedami eilutę simboliu „#“. Tai yra, viską, kas prasideda „#“, robotai ignoruos. Tai atveria pasaulį galimybių ir vidinių pokštų. Todėl raginame jus peržiūrėti windupschool, pccomponentes ar Minube robots.txt – tikrai užklupsite ką nors netikėto ?

Išvada
Kaip matėte, failas robots.txt gali pasiūlyti labai daug, bet kartu reikalauja daug atidumo, nes netinkamai įrašyta direktyva gali užblokuoti jūsų svetainės nuskaitymą.
Tikimės, kad šis vadovas jums pravers, o iškilus klausimams – susitiksime komentaruose.
Autorius: David Kaufmann

Pastaruosius 10+ metų praleidau visiškai apsėstas SEO — ir, tiesą sakant, nenorėčiau, kad būtų kitaip.
Mano karjera pakilo į naują lygį, kai dirbau vyresniuoju SEO specialistu Chess.com — vienoje iš 100 lankomiausių svetainių visame internete. Darbas tokiu mastu, apimant milijonus puslapių, dešimtis kalbų ir vieną konkurencingiausių SERPs, išmokė mane to, ko joks kursas ar sertifikatas niekada nebūtų galėjęs. Ta patirtis pakeitė mano supratimą apie tai, kaip iš tikrųjų atrodo puikus SEO — ir tapo pagrindu viskam, ką nuo tada sukūriau.
Iš tos patirties įkūriau SEO Alive — agentūrą prekės ženklams, kurie rimtai žiūri į organinį augimą. Mes čia ne tam, kad pardavinėtume dashboards ir mėnesines ataskaitas. Mes čia tam, kad kurtume strategijas, kurios iš tikrųjų daro poveikį, sujungdami tai, kas geriausia klasikiniame SEO, su jaudinančiu nauju Generative Engine Optimization (GEO) pasauliu — užtikrindami, kad jūsų prekės ženklas pasirodytų ne tik Google mėlynosiose nuorodose, bet ir AI sugeneruotuose atsakymuose, kuriuos ChatGPT, Perplexity ir Google AI Overviews kasdien pateikia milijonams žmonių.
Ir kadangi neradau įrankio, kuris tinkamai valdytų abu šiuos pasaulius, sukūriau jį pats — SEOcrawl, enterprise SEO intelligence platformą, kuri vienoje vietoje sujungia rankings, techninius auditus, backlinks stebėseną, crawl būklę ir AI prekės ženklo matomumo sekimą. Tai platforma, apie kurios egzistavimą visada svajojau.
Atraskite daugiau šio autoriaus turinio

