robots.txt: Täielik seadistamise juhend

Oled väsinud kuulmast robots.txt-st, teadmata, millest jutt käib? Ära muretse – täna toome sulle lahenduse su probleemile. Selles postituses selgitame nii hästi kui oskame, mis on robots.txt, kuidas seda seadistada (eriti WordPressis) ja millist mõju see võib avaldada meie projekti SEO-le.
Asugem asja kallale!
Mis on robots.txt ja milleks see mõeldud on?
robots.txt on lihtsalt veebisaidi juurkataloogis asuv fail, mis võimaldab takistada teatud robotitel (näiteks Google või Bing) sinu veebisaidi või selle osade külastamist.
TÄHELEPANU: oluline on teada, et tegemist on protokolliga, ja üldreeglina järgivad seda kõik „head“ robotid (GoogleBot, BingBot, Semrush, ...), kuid iga pahatahtlik robot võib sellest mööda minna, näiteks Screaming Frog, märkides ära selle valiku:

Miks on fail robots.txt SEO jaoks oluline?
Nagu varem mainisime, järgivad kõik head robotid (näiteks GoogleBot) seda protokolli, seega saame seda faili kasutada selleks, et juhtida Google'it läbi meie veebisaidi. Lehed, mille sa siin keelad, ilmuvad Google Search Console'is märkega „Blokeeritud robots.txt-ga“.
Mida? Mida sa mõtled? Juhtida Google'it robots.txt-ga?
Jah, ära muretse – selgitame seda näite abil, et kõik muutuks palju selgemaks:
Kujuta ette, et sinu veebisaidil on privaatne ala, millele pääsevad ligi ainult registreeritud kasutajad, ja nagu me hästi teame, ei pääse Google ligi ühelegi saidile, mis nõuab sisselogimist (veel...).
Niisiis, kas poleks mõistlik, et Google ei raiskaks meie roomamiseelarvet (crawl budget) selliste lehtede roomamisele, millel pole tema jaoks mingit väärtust?
Täpselt! Üks robots.txt-i olulisemaid kasutusalasid on blokeerida teed, millel on Google jaoks vähe väärtust, ja sundida teda sel viisil keskenduma meie veebisaidi tähtsatele lehtedele. Just seetõttu peaks robots.txt olema üks meie SEO-strateegia nurgakive.
See on vaid üks näide tuhandetest asjadest, mida me selle failiga teha saame. Muude näidete hulka kuuluvad meie saidikaardi (sitemap) märkimine, roomamisintervalli vähendamine, ressursside roomamise blokeerimine, ...
Kuidas luua robots.txt fail
Noh... asugem tööle!
Selle faili loomine on tõesti lihtne – sul on vaja vaid võtta oma tekstiredaktor (Notepad Windowsis või TextEdit Macis) või kasutada mõnda veebipõhist ning pärast robots.txt-i koostamist eksportida see txt-failina.
Kui see meil on, tuleb see vaid nimetada „robots.txt“-ks ja laadida oma veebisaidi juurkataloogi üles serveripaneeli kaudu või FTP kaudu.
Et kontrollida, kas see on õigesti üles laaditud, tuleb sul vaid lisada oma domeenile „/robots.txt“, näiteks https://seocrawl.com/robots.txt
TÄHELEPANU: ole vahemäluga ettevaatlik – parem on seda vaadata inkognito režiimis ;)
Aga kui mul on WordPress?
Kui sul on WordPress, on see lihtsam, sest parimad SEO pluginad, nagu Rank Math või Yoast, tulevad sisseehitatud lisandmooduliga, mis võimaldab robots.txt-i otse redigeerida.
Rank Mathi puhul leiad selle: Rank Math > General Settings > Edit robots.txt

Yoasti puhul peame minema: SEO > Tools > File Editor
Nii saad faili hõlpsalt redigeerida või luua, ilma et peaksid tegema ühtegi ülalkirjeldatud sammu.
Käsud
Järgnevalt vaatame paljusid meile saadaolevaid käske koos nende vastavate näidetega:
Blokeeri kogu veebisaidi roomamine
User-agent: * Disallow: /
MÄRKUS: kui sa alles arendad oma veebisaiti ega taha, et ükski robot sinna siseneks, sinu sisu loeks ja indekseeriks, sobib see reegel suurepäraselt.
Blokeeri lehe roomamine
User-agent: * Disallow: /lehe-url-mida-ma-ei-taha-roomata
Blokeeri kausta roomamine
User-agent: * Disallow: /kaust/
Luba juurdepääs lehele
User-agent: * Allow: /leht
Blokeeri kaust ja luba selles kaustas üks leht
User-agent: * Disallow: /kaust/ Allow: /kaust/leht
Märgi saidikaart (sitemap)
Sitemap: https://domain.com/sitemap.xml
Anna korraldusi konkreetsetele robotitele
Sellel peatume veidi pikemalt. Kui panid tähele, algas enamik eelnevaid direktiive nii:
User-agent: *
See „*“ viitab kõikidele robotitele. See tähendab, et kõik selle rea järel olevad direktiivid kehtivad kõikidele robotitele. Kui tahame saata konkreetseid korraldusi kindlatele robotitele, tuleb meil see muuta järgmiselt:
User-agent: Googlebot Kui tahame viidata Google'i robotile
User-agent: Bingbot Kui tahame viidata Bingi robotile
User-agent: DuckDuckBot Kui tahame viidata DuckDuckGo robotile
Sul tuleb vaid välja selgitada, mis on selle roboti nimi, kellele tahad korralduse anda, ja nimetada see nii, nagu me just näitasime.
Vaata üle ja testi robots.txt faili
Nüüd, kui oled lõpetanud oma robots-i „häälestamise“, et see oleks su veebisaidi jaoks täielikult optimeeritud ja kohandatud, jääb üle vaid seda testida.
Testida? Milleks?
Noh, testida selleks, et veenduda, et me pole üheski reas eksinud ja et see tegelikult töötab ning blokeerib need veebisaidi osad, mida me blokeerida tahame.
Selleks soovitame kasutada seda tööriista.

Kui oled sees, tuleb sul vaid:
-
Sisestada URL, mille puhul soovid kontrollida, kas roomamine on lubatud
-
Valida User Agent
-
Klõpsata TEST
Kohe seejärel laaditakse kogu meie robots.txt fail ning selle all öeldakse, kas juurdepääs on lubatud või mitte.

Sel juhul, nagu näeme, annab see positiivse tulemuse, kuid kui me sisestaksime URL-i, mis pole lubatud, tõstaks see esile ka rea, mis seda blokeerib:

Lisaks võimaldab see tööriist meil robots.txt faili otse sealtsamast redigeerida, et teha kõik vajalikud muudatused, nii et tulemus vastaks meie eesmärgile. Kui see on muudetud ja testitud, tuleb meil vaid rakendada need uued muudatused oma robots-ile.
Boonusnõuanne: tee oma robots.txt meeldejäävaks
Näitasime sulle hulganisti koodiridu, mis robotite jaoks toimivad, kuid sa võid lisada ka kommentaare, alustades rida märgiga „#“. See tähendab, et kõike, mis algab märgiga „#“, robotid eiravad. See avab terve maailma võimalusi ja sisemisi nalju. Just seetõttu julgustame sind vaatama windupschool, pccomponentes või Minube robots.txt-i – kohtad kindlasti midagi üllatavat ?

Kokkuvõte
Nagu nägid, on failil robots.txt palju pakkuda ja see nõuab ka suurt hoolt, sest valesti paigutatud direktiiv võib blokeerida sinu veebisaidi roomamise.
Loodame, et sellest juhendist on sulle kasu, ja küsimuste korral kohtume kommentaarides.
Autor: David Kaufmann

Olen viimased 10+ aastat olnud täielikult SEO-sse haaratud — ja ausalt öeldes ei tahaks ma seda teisiti.
Minu karjäär jõudis uuele tasemele, kui töötasin vanem-SEO-spetsialistina Chess.com-is — ühel 100 külastatuimast veebisaidist kogu internetis. Sellises mahus töötamine, hõlmates miljoneid lehti, kümneid keeli ja üht konkurentsitihedaimat SERPs, õpetas mulle asju, mida ükski kursus ega sertifikaat kunagi ei suudaks. See kogemus muutis minu arusaama sellest, milline suurepärane SEO tegelikult välja näeb — ja sai aluseks kõigele, mille olen sellest ajast peale üles ehitanud.
Sellest kogemusest lähtudes asutasin SEO Alive — agentuuri brändidele, kes suhtuvad orgaanilisse kasvu tõsiselt. Me ei ole siin selleks, et müüa dashboards ja igakuiseid aruandeid. Me oleme siin selleks, et luua strateegiaid, mis päriselt tulemusi liigutavad, ühendades klassikalise SEO parima osa põneva uue Generative Engine Optimization (GEO) maailmaga — tagades, et teie bränd ilmub mitte ainult Google'i sinistes linkides, vaid ka AI genereeritud vastustes, mida ChatGPT, Perplexity ja Google AI Overviews iga päev miljonitele inimestele edastavad.
Ja kuna ma ei leidnud tööriista, mis mõlemat neist maailmadest korralikult hallanuks, ehitasin selle ise — SEOcrawl, enterprise SEO intelligence platvormi, mis toob kokku rankings, tehnilised auditid, backlinks jälgimise, crawl tervise ja AI brändi nähtavuse jälgimise ühte kohta. See on platvorm, mille olemasolu ma alati soovisin.
Avastage rohkem selle autori sisu

