Robots.txt AI Bot Checker grátis: veja quais crawlers de IA chegam ao seu site
Cole o seu domínio ou o URL do robots.txt. Lemos o ficheiro, comparamos cada crawler de IA importante com as suas regras Allow e Disallow e dizemos-lhe, bot a bot, quais chegam ao seu site. Sem registo.
Grátis, sem registo. Lemos o seu robots.txt e mostramos quais crawlers de IA — GPTBot, ClaudeBot, Google-Extended, PerplexityBot e mais — você atualmente permite ou bloqueia.
O que o AI bot checker valida
- Veredicto por bot (Permitido, Parcial, Bloqueado) para cada user-agent de IA importante
- Crawlers de treino: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
- Crawlers de pesquisa: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
- Bots de acesso a pedido: ChatGPT-User, Claude-User, Perplexity-User
- Localização do URL do robots.txt e código de estado HTTP
- Conflitos entre User-agent: * e regras específicas por bot
- Caminhos proibidos por bot — para ver o que está escondido, não só o que está bloqueado
Porque o seu robots.txt importa mais do que antes
O seu robots.txt é a primeira coisa que um crawler lê, e hoje as empresas de IA operam vários crawlers com user-agents distintos. Só a OpenAI tem três: GPTBot para treino, OAI-SearchBot para o ChatGPT Search e ChatGPT-User para acessos a pedido. Anthropic, Google, Perplexity, Common Crawl e Meta têm cada uma os seus.
As decisões que toma neste ficheiro moldam dois resultados diferentes. Bloqueie os crawlers de pesquisa e a sua marca desaparece das respostas do ChatGPT, do Claude e do Perplexity. Deixe os crawlers de treino abertos quando pretendia recusar e os modelos de amanhã aprendem com o seu conteúdo de graça.
A maioria dos sites acaba por querer um e não o outro.
O que os dados dizem sobre bloquear bots de IA
Três números que vale a pena conhecer antes de escrever as regras.
Como ler o seu resultado
Permitido
O crawler pode aceder à raiz do seu site. Para bots de pesquisa como OAI-SearchBot, Claude-SearchBot e PerplexityBot, é isto que o mantém elegível para ser citado nas respostas de IA.
Parcial
O crawler consegue chegar ao seu site, mas alguns caminhos específicos estão proibidos. Normalmente está bem — vale a pena confirmar que não está a esconder páginas que quer destacar na pesquisa por IA.
Bloqueado
Uma regra Disallow: / trava o crawler por completo. Intencional para recusar o treino, mas um problema se for um crawler de pesquisa ao qual queria continuar visível.
Os erros mais comuns no robots.txt (e como corrigi-los)
Bloquear a pesquisa por IA por engano.
Um Disallow genérico que apanha o OAI-SearchBot, o Claude-SearchBot ou o PerplexityBot remove-o silenciosamente das respostas de IA.
Correção: Liste os crawlers de pesquisa nos seus próprios grupos User-agent e permita-os explicitamente.
Usar User-agent: * para bloquear a IA.
Esse grupo apanha também o Googlebot, o Bingbot e todos os crawlers de pesquisa normais, por isso a regra bloqueia muito mais do que pretendia.
Correção: Nomeie cada user-agent de IA no seu próprio grupo e deixe o wildcard em paz.
Confundir Google-Extended com Googlebot.
Bloqueie o errado e ou deixa o treino de IA ativo ou desindexa-se por engano do Google Search.
Correção: Use Google-Extended para recusar o treino do Gemini e do Vertex AI; deixe o Googlebot intocado para a Pesquisa orgânica.
Tratar o robots.txt como um firewall.
É indicativo. Os crawlers bem-comportados respeitam-no; os mal-intencionados e os scrapers de terceiros ignoram-no.
Correção: Adicione bloqueio do lado do servidor (regras de IA da Cloudflare, WAF, .htaccess) para os bots que tem mesmo de travar por completo.
A Cloudflare a sobrepor-se à sua regra Allow.
Desde julho de 2025, a Cloudflare bloqueia os bots de IA por defeito nos novos domínios, independentemente do que diz o seu robots.txt.
Correção: Abra o painel da Cloudflare, vá a Security → Bots → AI Scrapers and Crawlers e desative-o se quiser que os bots de pesquisa por IA cheguem ao seu site.
Quer saber se a IA o está mesmo a citar?
Uma auditoria ao robots.txt diz-lhe quais crawlers de IA conseguem chegar ao seu site. O AI Tracker da SEOcrawl AI diz-lhe o que fazem quando lá chegam. Descubra com que frequência o ChatGPT, o Claude, o Gemini e o Perplexity mencionam e citam a sua marca, que prompts a ativam e como se compara aos concorrentes que escolhe monitorizar — tudo combinado com os seus dados do Google Search Console no mesmo painel.
Perguntas frequentes
O que é um AI bot checker?
Uma ferramenta que lê o seu robots.txt e lhe diz quais crawlers de IA permite ou bloqueia, um bot de cada vez. Compara as suas regras Allow e Disallow com os tokens user-agent das principais empresas de IA: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl e outras.
O que é o GPTBot?
O GPTBot é o crawler web da OpenAI, lançado em agosto de 2023, usado para recolher conteúdo publicamente disponível para treinar os futuros modelos GPT. Não é o mesmo bot que o OAI-SearchBot, que alimenta o ChatGPT Search, nem o ChatGPT-User, que recupera uma página quando alguém pede a um assistente para a ler. Os três obedecem ao robots.txt de forma independente, por isso pode permitir um e bloquear outro.
Qual é a diferença entre bots de IA de treino, de pesquisa e a pedido?
Os bots de treino (GPTBot, CCBot, Google-Extended, Bytespider) recolhem conteúdo para treinar os modelos subjacentes. Os bots de pesquisa (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexam o seu site para que possa ser citado nas respostas de pesquisa por IA. Os bots de acesso a pedido (ChatGPT-User, Claude-User, Perplexity-User) recuperam uma única página em tempo real quando um utilizador pergunta ao assistente sobre ela. Cada um pode ser controlado separadamente no robots.txt.
Como bloqueio os crawlers de IA no robots.txt?
Adicione um grupo por crawler com uma regra Disallow. Por exemplo: "User-agent: GPTBot" seguido de "Disallow: /" na linha seguinte. Para bloquear vários, liste cada user-agent no seu próprio grupo. Lembre-se de que o robots.txt é indicativo: crawlers bem-comportados como o GPTBot e o ClaudeBot respeitam-no, mas não travará um bot que escolha ignorá-lo.
Devo bloquear ou permitir os bots de IA?
Depende do seu objetivo. Permita os bots de pesquisa (OAI-SearchBot, Claude-SearchBot, PerplexityBot) para que a sua marca possa ser citada nas respostas de IA. Bloqueie os bots de treino (GPTBot, CCBot, Google-Extended, Bytespider) apenas se tiver um motivo específico para recusar. O estudo Rutgers/Wharton concluiu que os editores que bloquearam os crawlers de IA em bloco perderam 23% do tráfego total, por isso as proibições generalizadas raramente compensam.
O ClaudeBot respeita o robots.txt?
Sim. A documentação oficial da Anthropic confirma que o ClaudeBot, o Claude-User e o Claude-SearchBot respeitam todas as diretivas padrão do robots.txt, incluindo a extensão não padrão Crawl-delay. Cada user-agent pode ser permitido ou bloqueado de forma independente, por isso pode recusar o treino mantendo-se citável nas respostas de pesquisa do Claude.
Bloquear o Google-Extended prejudica o meu posicionamento no Google?
Não. O Google-Extended só controla se o seu conteúdo é usado para treinar e fundamentar o Gemini e o Vertex AI. É um token separado do Googlebot, por isso bloquear o Google-Extended não tem efeito sobre como se posiciona na Google Search. É a forma limpa de recusar o treino de IA sem mexer na pesquisa orgânica.
O bloqueio predefinido de bots de IA da Cloudflare sobrepõe-se à minha regra Allow no robots.txt?
Sim, o bloqueio ao nível da rede prevalece. Desde 1 de julho de 2025, a Cloudflare bloqueia os bots de IA por defeito em cada novo domínio através da sua regra gerida "AI Scrapers and Crawlers", mesmo que o seu robots.txt diga Allow. Se um bot aparecer como Permitido neste checker mas não conseguir realmente recuperar as suas páginas, verifique as definições Cloudflare Security → Bots.





