Tutti gli strumenti gratis

Robots.txt AI Bot Checker gratuito: scopri quali crawler AI raggiungono il tuo sito

Incolla il tuo dominio o l'URL del robots.txt. Leggiamo il file, confrontiamo ogni crawler AI importante con le tue regole Allow e Disallow e ti diciamo, bot per bot, quali raggiungono il tuo sito. Senza registrazione.

Gratis, senza registrazione. Leggiamo il tuo robots.txt e ti mostriamo quali crawler AI — GPTBot, ClaudeBot, Google-Extended, PerplexityBot e altri — attualmente consenti o blocchi.

Cosa verifica l'AI bot checker

  • Esito per singolo bot (Consentito, Parziale, Bloccato) per ogni user-agent AI importante
  • Crawler di addestramento: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Crawler di ricerca: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Bot di recupero su richiesta: ChatGPT-User, Claude-User, Perplexity-User
  • Posizione dell'URL del robots.txt e codice di stato HTTP
  • Conflitti tra User-agent: * e regole specifiche per bot
  • Percorsi vietati per ogni bot — così vedi cosa è nascosto, non solo cosa è bloccato

Perché il tuo robots.txt conta più di prima

Il tuo robots.txt è la prima cosa che un crawler legge, e oggi le aziende AI gestiscono più crawler con user-agent distinti. Solo OpenAI ne ha tre: GPTBot per l'addestramento, OAI-SearchBot per ChatGPT Search e ChatGPT-User per i recuperi su richiesta. Anthropic, Google, Perplexity, Common Crawl e Meta hanno ciascuno i propri.

Le decisioni che prendi in questo file plasmano due esiti diversi. Blocca i crawler di ricerca e il tuo brand scompare dalle risposte di ChatGPT, Claude e Perplexity. Lascia aperti i crawler di addestramento quando volevi rinunciare e i modelli di domani impareranno dai tuoi contenuti gratis.

La maggior parte dei siti finisce col volere uno e non l'altro.

Cosa dicono i dati sul blocco dei bot AI

Tre numeri da conoscere prima di scrivere le regole.

Uno studio della Rutgers Business School e della Wharton (gennaio 2026) ha tracciato gli editori che bloccavano i crawler AI via robots.txt e ha rilevato che il loro traffico totale è calato in media del 23%. Il blocco non ferma solo i bot: taglia anche i clic provenienti dall'AI.
Un audit di BuzzStream su 100 dei principali siti di news ha rilevato che il 79% blocca almeno un bot di addestramento AI — cosa sensata — ma il 71% blocca anche almeno un bot di recupero o ricerca, di solito per errore. Il Disallow: / generico prende tutto.
I dati di Cloudflare mostrano che oltre 1 milione di clienti ha attivato l'interruttore con un clic “Block AI Scrapers” da luglio 2024. Dal 1 luglio 2025, ogni nuovo dominio su Cloudflare parte con i bot AI bloccati per default. Se il tuo robots.txt dice Allow ma i bot comunque non ti raggiungono, di solito è per questo.

Come leggere il tuo risultato

Consentito

Il crawler può accedere alla radice del tuo sito. Per i bot di ricerca come OAI-SearchBot, Claude-SearchBot e PerplexityBot, è questo che ti mantiene idoneo a essere citato nelle risposte AI.

Parziale

Il crawler può raggiungere il tuo sito, ma alcuni percorsi specifici sono vietati. Di solito va bene — vale la pena verificare di non nascondere pagine che vuoi far emergere nella ricerca AI.

Bloccato

Una regola Disallow: / ferma del tutto il crawler. Intenzionale per rinunciare all'addestramento, ma un problema se è un crawler di ricerca a cui volevi restare visibile.

Gli errori più comuni nel robots.txt (e come correggerli)

Bloccare la ricerca AI per sbaglio.

Un Disallow generico che colpisce OAI-SearchBot, Claude-SearchBot o PerplexityBot ti rimuove silenziosamente dalle risposte AI.

Soluzione: Elenca i crawler di ricerca in gruppi User-agent propri e consentili in modo esplicito.

Usare User-agent: * per bloccare l'AI.

Quel gruppo colpisce anche Googlebot, Bingbot e ogni normale crawler di ricerca, quindi la regola blocca molto più di quanto intendevi.

Soluzione: Nomina ogni user-agent AI nel suo gruppo e lascia stare il wildcard.

Confondere Google-Extended con Googlebot.

Blocca quello sbagliato e o lasci attivo l'addestramento AI o ti deindicizzi per sbaglio da Google Search.

Soluzione: Usa Google-Extended per rinunciare all'addestramento di Gemini e Vertex AI; lascia intatto Googlebot per la Ricerca organica.

Trattare il robots.txt come un firewall.

È indicativo. I crawler corretti lo rispettano; i malintenzionati e gli scraper di terze parti lo ignorano.

Soluzione: Aggiungi il blocco lato server (regole AI di Cloudflare, WAF, .htaccess) per i bot che devi fermare in modo netto.

Cloudflare che sovrascrive la tua regola Allow.

Da luglio 2025, Cloudflare blocca i bot AI per default sui nuovi domini, a prescindere da ciò che dice il tuo robots.txt.

Soluzione: Apri la dashboard di Cloudflare, vai su Security → Bots → AI Scrapers and Crawlers e disattivalo se vuoi che i bot di ricerca AI raggiungano il tuo sito.

Vuoi sapere se l'AI ti sta davvero citando?

Un audit del robots.txt ti dice quali crawler AI possono raggiungere il tuo sito. L'AI Tracker di SEOcrawl AI ti dice cosa fanno una volta arrivati. Scopri quanto spesso ChatGPT, Claude, Gemini e Perplexity menzionano e citano il tuo brand, quali prompt ti attivano e come ti posizioni rispetto ai concorrenti che scegli di monitorare — il tutto abbinato ai dati di Google Search Console nella stessa dashboard.

Domande frequenti

Cos'è un AI bot checker?

Uno strumento che legge il tuo robots.txt e ti dice quali crawler AI consenti o blocchi, un bot alla volta. Confronta le tue regole Allow e Disallow con i token user-agent delle principali aziende AI: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl e altri.

Cos'è GPTBot?

GPTBot è il crawler web di OpenAI, lanciato ad agosto 2023, usato per raccogliere contenuti pubblicamente disponibili per addestrare i futuri modelli GPT. Non è lo stesso bot di OAI-SearchBot, che alimenta ChatGPT Search, né di ChatGPT-User, che recupera una pagina quando qualcuno chiede a un assistente di leggerla. Tutti e tre obbediscono al robots.txt in modo indipendente, quindi puoi consentirne uno e bloccarne un altro.

Qual è la differenza tra bot AI di addestramento, ricerca e su richiesta?

I bot di addestramento (GPTBot, CCBot, Google-Extended, Bytespider) raccolgono contenuti per addestrare i modelli sottostanti. I bot di ricerca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indicizzano il tuo sito affinché possa essere citato nelle risposte di ricerca AI. I bot di recupero su richiesta (ChatGPT-User, Claude-User, Perplexity-User) recuperano una singola pagina in tempo reale quando un utente chiede all'assistente informazioni su di essa. Ciascuno può essere controllato separatamente nel robots.txt.

Come blocco i crawler AI nel robots.txt?

Aggiungi un gruppo per crawler con una regola Disallow. Ad esempio: "User-agent: GPTBot" seguito da "Disallow: /" sulla riga successiva. Per bloccarne diversi, elenca ogni user-agent nel proprio gruppo. Ricorda che il robots.txt è indicativo: i crawler corretti come GPTBot e ClaudeBot lo rispettano, ma non fermerà un bot che sceglie di ignorarlo.

Dovrei bloccare i bot AI o consentirli?

Dipende dal tuo obiettivo. Consenti i bot di ricerca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) affinché il tuo brand possa essere citato nelle risposte AI. Blocca i bot di addestramento (GPTBot, CCBot, Google-Extended, Bytespider) solo se hai un motivo specifico per rinunciare. Lo studio Rutgers/Wharton ha rilevato che gli editori che hanno bloccato i crawler AI in blocco hanno perso il 23% del traffico totale, quindi i divieti generalizzati raramente ripagano.

ClaudeBot rispetta il robots.txt?

Sì. La documentazione ufficiale di Anthropic conferma che ClaudeBot, Claude-User e Claude-SearchBot rispettano tutti le direttive standard del robots.txt, inclusa l'estensione non standard Crawl-delay. Ogni user-agent può essere consentito o bloccato in modo indipendente, così puoi rinunciare all'addestramento restando citabile nelle risposte di ricerca di Claude.

Bloccare Google-Extended danneggia il mio posizionamento su Google?

No. Google-Extended controlla solo se i tuoi contenuti vengono usati per addestrare e fondare Gemini e Vertex AI. È un token separato da Googlebot, quindi bloccare Google-Extended non ha alcun effetto su come ti posizioni in Google Search. È il modo pulito per rinunciare all'addestramento AI senza toccare la ricerca organica.

Il blocco predefinito dei bot AI di Cloudflare sovrascrive la mia regola Allow nel robots.txt?

Sì, il blocco a livello di rete prevale. Dal 1 luglio 2025, Cloudflare blocca i bot AI per default su ogni nuovo dominio tramite la sua regola gestita "AI Scrapers and Crawlers", anche se il tuo robots.txt dice Allow. Se un bot risulta Consentito in questo checker ma non riesce davvero a recuperare le tue pagine, controlla le impostazioni Cloudflare Security → Bots.