Kõik tasuta tööriistad

Tasuta Robots.txt AI-botite kontrollija: vaadake, millised AI-roomajad teie saidini jõuavad

Kleepige oma domeen või robots.txt URL. Loeme faili, võrdleme iga olulist AI-roomajat teie Allow- ja Disallow-reeglitega ning ütleme bot-haaval, millised teie saidini jõuavad. Registreerumist pole vaja.

Free, no sign-up. We read your robots.txt and show which AI crawlers — GPTBot, ClaudeBot, Google-Extended, PerplexityBot and more — you currently allow or block.

Mida AI-botite kontrollija kontrollib

  • Iga roomaja verdikt (Lubatud, Osaliselt, Blokeeritud) iga olulise AI kasutajaagendi kohta
  • Treeningroomajad: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Otsinguroomajad: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Nõudmisel toovad botid: ChatGPT-User, Claude-User, Perplexity-User
  • Robots.txt URL-i asukoht ja HTTP olekukood
  • Konfliktid User-agent: * ja botispetsiifiliste reeglite vahel
  • Keelatud teed iga boti kohta — et näeksite, mis on peidetud, mitte ainult mis on blokeeritud

Miks teie robots.txt on tähtsam kui varem

Teie robots.txt on esimene, mida roomaja loeb, ja AI-ettevõtted käitavad nüüd mitut roomajat eraldi kasutajaagentidega. Ainuüksi OpenAI-l on kolm: GPTBot treeninguks, OAI-SearchBot ChatGPT Searchi jaoks ja ChatGPT-User nõudmisel toomiseks. Anthropicul, Google'il, Perplexityl, Common Crawlil ja Metal on igaühel omad.

Otsused, mille selles failis teete, kujundavad kaht erinevat tulemust. Blokeerige otsinguroomajad ja teie bränd kaob ChatGPT, Claude'i ja Perplexity vastustest. Jätke treeningroomajad avatuks, kui soovisite loobuda, ja homsed mudelid õpivad teie sisust tasuta.

Enamik saite tahab lõpuks üht, mitte teist.

Mida andmed ütlevad AI-botite blokeerimise kohta

Kolm arvu, mida tasub teada enne reeglite kirjutamist.

Rutgers Business Schooli ja Whartoni uuring (jaanuar 2026) jälgis väljaandjaid, kes blokeerisid AI-roomajad robots.txt kaudu, ja leidis, et nende koguliiklus langes keskmiselt 23%. Blokeerimine ei peata ainult botte; see katkestab ka AI kaudu tulnud klikid.
BuzzStreami audit 100 juhtiva uudistesaidi kohta leidis, et 79% blokeerib vähemalt ühe AI-treeningboti — mõistlik — kuid 71% blokeerib ka vähemalt ühe otsingu- või toomisboti, tavaliselt kogemata. Üldine Disallow: / püüab kõik kinni.
Cloudflare'i enda andmed näitavad, et alates 2024. aasta juulist on üle 1 miljoni kliendi lülitanud sisse ühe klõpsu „Block AI Scrapers“ lüliti. Alates 1. juulist 2025 käivitub iga uus domeen Cloudflare'is vaikimisi blokeeritud AI-botitega. Kui teie robots.txt ütleb Allow, kuid botid teieni ikkagi ei jõua, on põhjus tavaliselt just see.

Kuidas lugeda oma tulemust

Lubatud

Roomaja pääseb teie saidi juurkataloogi. Otsingubottide, nagu OAI-SearchBot, Claude-SearchBot ja PerplexityBot, puhul on just see see, mis hoiab teid tsiteeritavana AI-vastustes.

Osaliselt

Roomaja pääseb teie saidile, kuid teatud teed on keelatud. Tavaliselt korras — tasub veenduda, et te ei peida lehti, mida soovite AI-otsingus näidata.

Blokeeritud

Reegel Disallow: / peatab roomaja täielikult. Tahtlik treeningust loobumisel, kuid probleem, kui tegu on otsinguroomajaga, kellele soovisite nähtavaks jääda.

Levinuimad robots.txt vead (ja kuidas neid parandada)

AI-otsingu kogemata blokeerimine.

Üldine Disallow, mis püüab kinni OAI-SearchBoti, Claude-SearchBoti või PerplexityBoti, eemaldab teid vaikselt AI-vastustest.

Fix: Loetlege otsinguroomajad omaette User-agent rühmades ja lubage need selgesõnaliselt.

AI blokeerimine User-agent: * abil.

See rühm püüab kinni ka Googlebot'i, Bingbot'i ja iga tavalise otsinguroomaja, seega blokeerib reegel palju rohkem, kui kavatsesite.

Fix: Nimetage iga AI kasutajaagent omaette rühmas ja jätke metamärk rahule.

Google-Extended'i segiajamine Googlebot'iga.

Vale blokeerides jätate kas AI-treeningu sisse või eemaldate end kogemata Google'i otsinguindeksist.

Fix: Kasutage Google-Extended'i, et loobuda Gemini ja Vertexi treeningust; jätke Googlebot orgaanilise otsingu jaoks puutumata.

Robots.txt käsitlemine tulemüürina.

See on üksnes soovituslik. Hästikäituvad roomajad järgivad seda; pahatahtlikud tegutsejad ja kolmandate osapoolte kraapijad eiravad seda.

Fix: Lisage serveripoolne blokeerimine (Cloudflare'i AI-reeglid, WAF, .htaccess) bottidele, mille peate kindlalt peatama.

Cloudflare tühistab teie Allow-reegli.

Alates 2025. aasta juulist blokeerib Cloudflare uutel domeenidel AI-botid vaikimisi, sõltumata sellest, mida teie robots.txt ütleb.

Fix: Avage Cloudflare'i juhtpaneel, minge Security → Bots → AI Scrapers and Crawlers ja lülitage see välja, kui soovite, et AI-otsingubotid teie saidini jõuaksid.

Kas soovite teada, kas AI teid tegelikult tsiteerib?

Robots.txt audit ütleb, millised AI-roomajad teie saidini pääsevad. SEOcrawl AI Tracker ütleb, mida nad kohale jõudes teevad. Saage teada, kui sageli ChatGPT, Claude, Gemini ja Perplexity teie brändi mainivad ja tsiteerivad, millised päringud teid vallandavad ja kuidas te paistate võrreldes valitud jälgitavate konkurentidega — koos teie Google Search Console'i andmetega samal juhtpaneelil.

KKK

Mis on AI-botite kontrollija?

Tööriist, mis loeb teie robots.txt-i ja ütleb bot-haaval, milliseid AI-roomajaid te lubate või blokeerite. See võrdleb teie Allow- ja Disallow-reegleid suurte AI-ettevõtete kasutajaagentide märgenditega: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl ja teised.

Mis on GPTBot?

GPTBot on OpenAI veebiroomaja, mis käivitati 2023. aasta augustis ja kogub avalikult kättesaadavat sisu tulevaste GPT-mudelite treenimiseks. See ei ole sama bot kui OAI-SearchBot, mis käitab ChatGPT Searchi, ega ChatGPT-User, mis toob lehe, kui keegi palub assistendil seda lugeda. Kõik kolm järgivad robots.txt-i sõltumatult, nii et ühe võite lubada ja teise blokeerida.

Mis vahe on treening-, otsingu- ja nõudmisel AI-bottidel?

Treeningbotid (GPTBot, CCBot, Google-Extended, Bytespider) kraabivad sisu aluseks olevate mudelite treenimiseks. Otsingubotid (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indekseerivad teie saidi, et seda saaks AI-otsingu vastustes tsiteerida. Nõudmisel toovad botid (ChatGPT-User, Claude-User, Perplexity-User) toovad reaalajas ühe lehe, kui kasutaja assistendilt selle kohta küsib. Igaüht saab robots.txt-is eraldi juhtida.

Kuidas blokeerida AI-roomajaid robots.txt-is?

Lisage iga roomaja jaoks üks rühm Disallow-reegliga. Näiteks: „User-agent: GPTBot“, millele järgneb järgmisel real „Disallow: /“. Mitme blokeerimiseks loetlege iga kasutajaagent omaette rühmas. Pidage meeles, et robots.txt on üksnes soovituslik: hästikäituvad roomajad nagu GPTBot ja ClaudeBot järgivad seda, kuid see ei peata botti, kes otsustab seda eirata.

Kas blokeerida AI-botid või lubada need?

See sõltub teie eesmärgist. Lubage otsingubotid (OAI-SearchBot, Claude-SearchBot, PerplexityBot), et teie brändi saaks AI-vastustes tsiteerida. Blokeerige treeningbotid (GPTBot, CCBot, Google-Extended, Bytespider) ainult siis, kui teil on konkreetne põhjus loobuda. Rutgersi/Whartoni uuring leidis, et väljaandjad, kes blokeerisid AI-roomajad täielikult, kaotasid 23% oma koguliiklusest, seega üldised keelud tasuvad end harva ära.

Kas ClaudeBot järgib robots.txt-i?

Jah. Anthropicu ametlik dokumentatsioon kinnitab, et ClaudeBot, Claude-User ja Claude-SearchBot järgivad kõik standardseid robots.txt-i direktiive, sealhulgas mittestandardset Crawl-delay laiendust. Iga kasutajaagenti saab lubada või blokeerida sõltumatult, nii et võite loobuda treeningust ja jääda samal ajal Claude'i otsinguvastustes tsiteeritavaks.

Kas Google-Extended'i blokeerimine kahjustab mu Google'i edetabelikohta?

Ei. Google-Extended kontrollib ainult seda, kas teie sisu kasutatakse Gemini ja Vertex AI treenimiseks ja põhistamiseks. See on Googlebot'ist eraldi märgend, seega Google-Extended'i blokeerimine ei mõjuta seda, kuidas te Google'i otsingus asetsete. See on puhas viis AI-treeningust loobuda, orgaanilist otsingut puutumata.

Kas Cloudflare'i vaikimisi AI-botite blokeering tühistab mu robots.txt Allow-reegli?

Jah, võrgutasandi blokeerimine võidab. Alates 1. juulist 2025 blokeerib Cloudflare igal uuel domeenil AI-botid vaikimisi oma hallatava reegli „AI Scrapers and Crawlers“ kaudu, isegi kui teie robots.txt ütleb Allow. Kui bot kuvatakse selles kontrollijas kui Lubatud, kuid ei suuda tegelikult teie lehti tuua, kontrollige oma Cloudflare Security → Bots seadeid.