robots.txt: Išsamus konfigūravimo vadovas

robots.txt: Išsamus konfigūravimo vadovas
David Kaufmann
SEO pamokos

Pavargote girdėti apie robots.txt ir nesuprantate, apie ką kalbama? Nesijaudinkite – šiandien pateiksime jūsų problemos sprendimą. Šiame įraše kuo aiškiau paaiškinsime, kas yra robots.txt, kaip jį sukonfigūruoti (ypač WordPress aplinkoje) ir kokį poveikį jis gali turėti mūsų projekto SEO.

Nedelskime!

Kas yra robots.txt ir kam jis skirtas?

robots.txt – tai tiesiog failas, talpinamas jūsų svetainės šakniniame kataloge, kuris leidžia neleisti tam tikriems robotams (pavyzdžiui, „Google“ ar „Bing“) lankyti jūsų svetainės ar jos dalių.

DĖMESIO: svarbu žinoti, kad tai yra protokolas, ir paprastai visi „geri“ robotai jo laikosi (GoogleBot, BingBot, Semrush, ...), tačiau bet kuris blogų ketinimų turintis robotas gali jį apeiti, pavyzdžiui, „Screaming Frog“, pažymėjus šią parinktį:

ignoruoti robots.txt Screaming Frog programoje
ignoruoti robots.txt Screaming Frog programoje

Kodėl failas robots.txt svarbus SEO?

Kaip jau minėjome, visi geri robotai (pavyzdžiui, GoogleBot) laikosi šio protokolo, todėl šį failą galime panaudoti tam, kad nukreiptume „Google“ po mūsų svetainę. Puslapiai, kuriuos čia uždrausite, „Google Search Console“ sistemoje pasirodys su žyma „Blokuota robots.txt failo“.

Ką? Kaip tai suprasti? Nukreipti „Google“ su robots.txt?

Taip, nesijaudinkite – paaiškinsime pavyzdžiu, kad viskas taptų kur kas aiškiau:

Įsivaizduokite, kad savo svetainėje turite privačią sritį, prie kurios prieigą turi tik registruoti naudotojai, o, kaip gerai žinome, „Google“ negali pasiekti jokios svetainės, kuriai reikia prisijungti (kol kas...).

Taigi, argi neverta, kad „Google“ neeikvotų mūsų nuskaitymo biudžeto (crawl budget) tiems puslapiams, kurie jam neturi jokios vertės, nuskaityti?

Būtent! Viena svarbiausių robots.txt paskirčių – blokuoti mažavertes „Google“ atžvilgiu vietas ir taip priversti jį sutelkti dėmesį į svarbius mūsų svetainės puslapius. Dėl šios priežasties robots.txt turėtų būti vienas iš mūsų SEO strategijos ramsčių.

Tai tik vienas pavyzdys iš tūkstančių dalykų, kuriuos galime nuveikti su šiuo failu. Kiti pavyzdžiai – nurodyti mūsų svetainės žemėlapį (sitemap), sumažinti nuskaitymo intervalą, blokuoti išteklių nuskaitymą, ...

Kaip sukurti robots.txt failą

Na... imkimės darbo!

Sukurti šį failą tikrai paprasta: tereikia paimti savo tekstų rengyklę („Notepad“ sistemoje „Windows“ arba „TextEdit“ sistemoje „Mac“) arba pasinaudoti internetine ir, parengus robots.txt, eksportuoti jį kaip txt failą.

Kai jį turėsime, tereikia pavadinti jį „robots.txt“ ir įkelti į savo svetainės šakninį katalogą per serverio valdymo skydelį arba per FTP.

Norėdami patikrinti, ar jis įkeltas teisingai, tiesiog prie savo domeno pridėkite „/robots.txt“, pavyzdžiui https://seocrawl.com/robots.txt

DĖMESIO: būkite atsargūs su podėliu (cache) – geriau peržiūrėkite jį inkognito režimu ;)

O jei turiu WordPress?

Jei turite WordPress, viskas dar paprasčiau, nes geriausi SEO papildiniai, tokie kaip Rank Math ar Yoast, turi integruotą įrankį robots.txt redaguoti tiesiogiai.

„Rank Math“ atveju jį rasite: Rank Math > General Settings > Edit robots.txt

Robots TXT sistemoje Wordpress
Robots TXT sistemoje Wordpress

„Yoast“ atveju reikės eiti į: SEO > Tools > File Editor

Taip galėsite lengvai redaguoti ar sukurti failą, nereikalaudami atlikti nė vieno iš aukščiau aprašytų veiksmų.

Komandos

Toliau apžvelgsime daugelį mums prieinamų komandų kartu su atitinkamais pavyzdžiais:

Blokuoti visos svetainės nuskaitymą

User-agent: * Disallow: /

PASTABA: jei kuriate savo svetainę ir nenorite, kad joks robotas patektų į ją, skaitytų ir indeksuotų jūsų turinį, ši taisyklė puikiai tinka.

Blokuoti puslapio nuskaitymą

User-agent: * Disallow: /puslapio-kurio-nenoriu-nuskaityti-url

Blokuoti aplanko nuskaitymą

User-agent: * Disallow: /aplankas/

Leisti prieigą prie puslapio

User-agent: * Allow: /puslapis

Blokuoti aplanką, bet leisti puslapį tame aplanke

User-agent: * Disallow: /aplankas/ Allow: /aplankas/puslapis

Nurodyti svetainės žemėlapį (sitemap)

Sitemap: https://domain.com/sitemap.xml

Duoti nurodymus konkretiems robotams

Šiuo atveju sustosime kiek ilgiau. Jei pastebėjote, dauguma ankstesnių direktyvų prasidėjo:

User-agent: *

Tas „*“ reiškia visus robotus. Tai yra, visos po tos eilutės esančios direktyvos taikomos visiems robotams. Jei norime siųsti konkrečius nurodymus tam tikriems robotams, tą reikės pakeisti taip:

User-agent: Googlebot Jei norime nurodyti „Google“ robotą

User-agent: Bingbot Jei norime nurodyti „Bing“ robotą

User-agent: DuckDuckBot Jei norime nurodyti „DuckDuckGo“ robotą

Tereikia išsiaiškinti, kaip vadinasi robotas, kuriam norite duoti nurodymą, ir pavadinti jį taip, kaip ką tik parodėme.

Peržiūrėkite ir patikrinkite robots.txt failą

Dabar, kai baigėte „derinti“ savo robots, kad jis būtų visiškai optimizuotas ir pritaikytas jūsų svetainei, belieka jį išbandyti.

Išbandyti? Kam?

Na, išbandyti tam, kad įsitikintume, jog niekur nesuklydome, ir kad jis iš tikrųjų veikia bei blokuoja tas svetainės dalis, kurias norime blokuoti.

Tam rekomenduojame naudoti šį įrankį.

Įrankis robots txt tikrinti 1.jpg
Įrankis robots txt tikrinti 1.jpg

Kai būsite viduje, tereikia:

  • Įvesti URL, kurio norite patikrinti, ar leidžiamas nuskaitymas

  • Pasirinkti User Agent

  • Spustelėti TEST

Iškart po to bus įkeltas visas mūsų robots.txt failas, o po juo bus nurodyta, ar prieiga leidžiama, ar ne.

Robots txt testo rezultatas.jpg
Robots txt testo rezultatas.jpg

Šiuo atveju, kaip matome, jis pateikia teigiamą rezultatą, tačiau jei įvestume neleidžiamą URL, jis taip pat paryškintų eilutę, kuri jį blokuoja:

Pavyzdys URL, blokuoto robots txt.jpg
Pavyzdys URL, blokuoto robots txt.jpg

Be to, šis įrankis leidžia mums redaguoti robots.txt failą tiesiogiai iš ten ir atlikti bet kokius reikiamus pakeitimus, kad rezultatas atitiktų mūsų tikslą. Kai pakeisite ir išbandysite, tereikia pritaikyti tuos naujus pakeitimus savo robots.

Papildomas patarimas: padarykite savo robots.txt nepamirštamą

Parodėme jums daugybę kodo eilučių, kurios veikia robotams, tačiau galite įterpti ir komentarus, pradedami eilutę simboliu „#“. Tai yra, viską, kas prasideda „#“, robotai ignoruos. Tai atveria pasaulį galimybių ir vidinių pokštų. Todėl raginame jus peržiūrėti windupschool, pccomponentes ar Minube robots.txt – tikrai užklupsite ką nors netikėto ?

Minube Robots TXT
Minube Robots TXT

Išvada

Kaip matėte, failas robots.txt gali pasiūlyti labai daug, bet kartu reikalauja daug atidumo, nes netinkamai įrašyta direktyva gali užblokuoti jūsų svetainės nuskaitymą.

Tikimės, kad šis vadovas jums pravers, o iškilus klausimams – susitiksime komentaruose.

Autorius: David Kaufmann

David Kaufmann

Pastaruosius 10+ metų praleidau visiškai apsėstas SEO — ir, tiesą sakant, nenorėčiau, kad būtų kitaip.

Mano karjera pakilo į naują lygį, kai dirbau vyresniuoju SEO specialistu Chess.com — vienoje iš 100 lankomiausių svetainių visame internete. Darbas tokiu mastu, apimant milijonus puslapių, dešimtis kalbų ir vieną konkurencingiausių SERPs, išmokė mane to, ko joks kursas ar sertifikatas niekada nebūtų galėjęs. Ta patirtis pakeitė mano supratimą apie tai, kaip iš tikrųjų atrodo puikus SEO — ir tapo pagrindu viskam, ką nuo tada sukūriau.

Iš tos patirties įkūriau SEO Alive — agentūrą prekės ženklams, kurie rimtai žiūri į organinį augimą. Mes čia ne tam, kad pardavinėtume dashboards ir mėnesines ataskaitas. Mes čia tam, kad kurtume strategijas, kurios iš tikrųjų daro poveikį, sujungdami tai, kas geriausia klasikiniame SEO, su jaudinančiu nauju Generative Engine Optimization (GEO) pasauliu — užtikrindami, kad jūsų prekės ženklas pasirodytų ne tik Google mėlynosiose nuorodose, bet ir AI sugeneruotuose atsakymuose, kuriuos ChatGPT, Perplexity ir Google AI Overviews kasdien pateikia milijonams žmonių.

Ir kadangi neradau įrankio, kuris tinkamai valdytų abu šiuos pasaulius, sukūriau jį pats — SEOcrawl, enterprise SEO intelligence platformą, kuri vienoje vietoje sujungia rankings, techninius auditus, backlinks stebėseną, crawl būklę ir AI prekės ženklo matomumo sekimą. Tai platforma, apie kurios egzistavimą visada svajojau.

→ Skaitykite visus David straipsnius
Daugiau šio autoriaus straipsnių: David Kaufmann

Atraskite daugiau šio autoriaus turinio