Verificator gratuit robots.txt pentru boți AI: vezi ce crawlere AI ajung la site-ul tău
Lipește domeniul sau URL-ul robots.txt. Citim fișierul, comparăm fiecare crawler AI major cu regulile tale Allow și Disallow și îți spunem, bot cu bot, care dintre ele ajung la site-ul tău. Fără înregistrare.
Gratuit, fără înregistrare. Îți citește robots.txt și îți arată ce crawlere AI — GPTBot, ClaudeBot, Google-Extended, PerplexityBot și altele — permiți sau blochezi în prezent.
Ce validează verificatorul de boți AI
- Verdict per bot (Permis, Parțial, Blocat) pentru fiecare user-agent AI major
- Crawlere de antrenare: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
- Crawlere de căutare: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
- Boți de preluare la cerere: ChatGPT-User, Claude-User, Perplexity-User
- Locația URL-ului robots.txt și codul de stare HTTP
- Conflicte între User-agent: * și regulile specifice fiecărui bot
- Căi interzise pentru fiecare bot — ca să vezi ce este ascuns, nu doar ce este blocat
De ce contează robots.txt mai mult decât înainte
Fișierul tău robots.txt este primul lucru pe care îl citește un crawler, iar companiile AI operează acum mai multe crawlere cu user-agenți separați. Doar OpenAI are trei: GPTBot pentru antrenare, OAI-SearchBot pentru ChatGPT Search și ChatGPT-User pentru preluări la cerere. Anthropic, Google, Perplexity, Common Crawl și Meta au fiecare crawlerele lor.
Deciziile pe care le iei în acest fișier modelează două rezultate diferite. Blochează crawlerele de căutare și brandul tău dispare din răspunsurile ChatGPT, Claude și Perplexity. Lasă crawlerele de antrenare deschise când voiai de fapt să renunți și modelele de mâine vor învăța gratuit din conținutul tău.
Majoritatea site-urilor ajung să și-l dorească pe unul, dar nu și pe celălalt.
Ce spun datele despre blocarea boților AI
Trei cifre pe care merită să le știi înainte de a scrie regulile.
Cum să citești rezultatul
Permis
Crawlerul poate ajunge la rădăcina site-ului tău. Pentru boți de căutare precum OAI-SearchBot, Claude-SearchBot și PerplexityBot, tocmai asta te menține eligibil pentru a fi citat în răspunsurile AI.
Parțial
Crawlerul poate ajunge la site-ul tău, dar anumite căi sunt interzise. De obicei nu este o problemă — merită să confirmi că nu ascunzi pagini pe care vrei să le scoți în evidență în căutarea AI.
Blocat
O regulă Disallow: / oprește complet crawlerul. Intenționat pentru renunțarea la antrenare, dar o problemă dacă este un crawler de căutare față de care voiai să rămâi vizibil.
Cele mai frecvente greșeli din robots.txt (și cum să le repari)
Blochezi din greșeală căutarea AI.
Un Disallow general care prinde OAI-SearchBot, Claude-SearchBot sau PerplexityBot te elimină pe tăcute din răspunsurile AI.
Soluție: Listează crawlerele de căutare în propriile grupuri User-agent și permite-le explicit.
Folosești User-agent: * pentru a bloca AI.
Acel grup prinde și Googlebot, Bingbot și fiecare crawler de căutare obișnuit, așa că regula blochează mult mai mult decât ai intenționat.
Soluție: Denumește fiecare user-agent AI în propriul grup și lasă wildcard-ul în pace.
Confunzi Google-Extended cu Googlebot.
Blochezi pe cel greșit și fie lași antrenarea AI activă, fie te dezindexezi din greșeală din Căutarea Google.
Soluție: Folosește Google-Extended pentru a renunța la antrenarea Gemini și Vertex; lasă Googlebot neatins pentru Căutarea organică.
Tratezi robots.txt ca pe un firewall.
Este orientativ. Crawlerele care se comportă corect îl respectă; actorii răuvoitori și scraperele terțe îl ignoră.
Soluție: Adaugă blocare la nivel de server (reguli AI Cloudflare, WAF, .htaccess) pentru boții pe care trebuie să-i oprești complet.
Cloudflare îți suprascrie regula Allow.
Din iulie 2025, Cloudflare blochează implicit boții AI pe domeniile noi, indiferent ce spune robots.txt.
Soluție: Deschide panoul Cloudflare, mergi la Security → Bots → AI Scrapers and Crawlers și dezactivează-l dacă vrei ca boții de căutare AI să ajungă la site-ul tău.
Vrei să vezi dacă AI chiar te citează?
Un audit robots.txt îți spune care crawlere AI pot ajunge la site-ul tău. AI Tracker de la SEOcrawl îți spune ce fac odată ce au ajuns acolo. Află cât de des te menționează și te citează ChatGPT, Claude, Gemini și Perplexity, ce prompturi te declanșează și cum te compari cu concurenții pe care alegi să îi monitorizezi — totul alături de datele tale Google Search Console, pe același panou.
Întrebări frecvente
Ce este un verificator de boți AI?
Un instrument care îți citește robots.txt și îți spune ce crawlere AI permiți sau blochezi, câte un bot pe rând. Compară regulile tale Allow și Disallow cu tokenurile user-agent ale marilor companii AI: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl și altele.
Ce este GPTBot?
GPTBot este crawlerul web al OpenAI, lansat în august 2023, folosit pentru a colecta conținut disponibil public în vederea antrenării viitoarelor modele GPT. Nu este același bot cu OAI-SearchBot, care alimentează ChatGPT Search, sau cu ChatGPT-User, care preia o pagină atunci când cineva îi cere unui asistent să o citească. Toți trei respectă robots.txt în mod independent, așa că poți permite unul și bloca altul.
Care este diferența dintre boții AI de antrenare, de căutare și de preluare la cerere?
Boții de antrenare (GPTBot, CCBot, Google-Extended, Bytespider) extrag conținut pentru a antrena modelele de bază. Boții de căutare (OAI-SearchBot, Claude-SearchBot, PerplexityBot) îți indexează site-ul ca să poată fi citat în răspunsurile căutării AI. Boții de preluare la cerere (ChatGPT-User, Claude-User, Perplexity-User) preiau o singură pagină în timp real atunci când un utilizator îl întreabă pe asistent despre ea. Fiecare poate fi controlat separat în robots.txt.
Cum blochez crawlerele AI în robots.txt?
Adaugă câte un grup per crawler cu o regulă Disallow. De exemplu: „User-agent: GPTBot” urmat de „Disallow: /” pe rândul următor. Pentru a bloca mai multe, listează fiecare user-agent în propriul grup. Reține că robots.txt este orientativ: crawlerele care se comportă corect, precum GPTBot și ClaudeBot, îl respectă, dar nu va opri un bot care alege să îl ignore.
Ar trebui să blochez sau să permit boții AI?
Depinde de obiectivul tău. Permite boții de căutare (OAI-SearchBot, Claude-SearchBot, PerplexityBot) ca brandul tău să poată fi citat în răspunsurile AI. Blochează boții de antrenare (GPTBot, CCBot, Google-Extended, Bytespider) doar dacă ai un motiv anume să renunți. Studiul Rutgers/Wharton a constatat că editorii care au blocat crawlerele AI în bloc au pierdut 23% din traficul lor total, așa că interdicțiile generale rareori se dovedesc profitabile.
ClaudeBot respectă robots.txt?
Da. Documentația oficială Anthropic confirmă că ClaudeBot, Claude-User și Claude-SearchBot respectă toate directivele standard robots.txt, inclusiv extensia non-standard Crawl-delay. Fiecare user-agent poate fi permis sau blocat independent, așa că poți renunța la antrenare rămânând totuși citabil în răspunsurile de căutare Claude.
Blocarea Google-Extended îmi afectează pozițiile în Google?
Nu. Google-Extended controlează doar dacă conținutul tău este folosit pentru a antrena și a fundamenta Gemini și Vertex AI. Este un token separat de Googlebot, așa că blocarea Google-Extended nu are niciun efect asupra modului în care te poziționezi în Căutarea Google. Este modalitatea curată de a renunța la antrenarea AI fără a atinge căutarea organică.
Blocarea implicită a boților AI de la Cloudflare îmi va suprascrie regula Allow din robots.txt?
Da, blocarea la nivel de rețea are prioritate. Începând cu 1 iulie 2025, Cloudflare blochează implicit boții AI pe fiecare domeniu nou prin regula gestionată „AI Scrapers and Crawlers”, chiar dacă robots.txt spune Allow. Dacă un bot apare ca Permis în acest verificator, dar nu îți poate prelua efectiv paginile, verifică setările Cloudflare Security → Bots.