Robots.txt AI Bot Checker grátis: veja quais crawlers de IA chegam ao seu site
Cole o seu domínio ou a URL do robots.txt. A gente lê o arquivo, compara cada crawler de IA importante com as suas regras Allow e Disallow e diz, bot a bot, quais chegam ao seu site. Sem cadastro.
Free, no sign-up. We read your robots.txt and show which AI crawlers — GPTBot, ClaudeBot, Google-Extended, PerplexityBot and more — you currently allow or block.
O que o AI bot checker valida
- Veredito por bot (Permitido, Parcial, Bloqueado) para cada user-agent de IA importante
- Crawlers de treinamento: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
- Crawlers de busca: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
- Bots de acesso sob demanda: ChatGPT-User, Claude-User, Perplexity-User
- Localização da URL do robots.txt e código de status HTTP
- Conflitos entre User-agent: * e regras específicas por bot
- Caminhos bloqueados por bot — para você ver o que está escondido, não só o que está bloqueado
Por que o seu robots.txt importa mais do que antes
O seu robots.txt é a primeira coisa que um crawler lê, e hoje as empresas de IA rodam vários crawlers com user-agents diferentes. Só a OpenAI tem três: GPTBot para treinamento, OAI-SearchBot para o ChatGPT Search e ChatGPT-User para acessos sob demanda. Anthropic, Google, Perplexity, Common Crawl e Meta têm cada uma os seus.
As decisões que você toma nesse arquivo geram dois resultados diferentes. Bloqueie os crawlers de busca e a sua marca some das respostas do ChatGPT, do Claude e do Perplexity. Deixe os crawlers de treinamento abertos quando a intenção era recusar e os modelos de amanhã vão aprender com o seu conteúdo de graça.
A maioria dos sites acaba querendo um e não o outro.
O que os dados dizem sobre bloquear bots de IA
Três números que vale a pena conhecer antes de escrever as regras.
Como ler o seu resultado
Permitido
O crawler consegue acessar a raiz do seu site. Para bots de busca como OAI-SearchBot, Claude-SearchBot e PerplexityBot, é isso que mantém você elegível para ser citado nas respostas de IA.
Parcial
O crawler chega ao seu site, mas alguns caminhos específicos estão bloqueados. Normalmente tudo bem — vale confirmar que você não está escondendo páginas que quer destacar na busca por IA.
Bloqueado
Uma regra Disallow: / trava o crawler por completo. Faz sentido para recusar o treinamento, mas é um problema se for um crawler de busca para o qual você queria continuar visível.
Os erros mais comuns no robots.txt (e como corrigir)
Bloquear a busca por IA sem querer.
Um Disallow genérico que pega o OAI-SearchBot, o Claude-SearchBot ou o PerplexityBot tira você das respostas de IA silenciosamente.
Fix: Liste os crawlers de busca em grupos User-agent próprios e permita cada um de forma explícita.
Usar User-agent: * para bloquear a IA.
Esse grupo pega também o Googlebot, o Bingbot e todos os crawlers de busca comuns, então a regra bloqueia muito mais do que você pretendia.
Fix: Nomeie cada user-agent de IA no grupo dele e deixe o wildcard em paz.
Confundir Google-Extended com Googlebot.
Bloqueie o errado e você deixa o treinamento de IA ligado ou se desindexa do Google Search sem querer.
Fix: Use Google-Extended para recusar o treinamento do Gemini e do Vertex AI; deixe o Googlebot intocado para a busca orgânica.
Tratar o robots.txt como um firewall.
Ele é indicativo. Os crawlers bem-comportados respeitam; os mal-intencionados e os scrapers de terceiros ignoram.
Fix: Adicione bloqueio no lado do servidor (regras de IA da Cloudflare, WAF, .htaccess) para os bots que você precisa travar de verdade.
A Cloudflare passando por cima da sua regra Allow.
Desde julho de 2025, a Cloudflare bloqueia os bots de IA por padrão nos domínios novos, independentemente do que diz o seu robots.txt.
Fix: Abra o painel da Cloudflare, vá em Security → Bots → AI Scrapers and Crawlers e desative se você quiser que os bots de busca por IA cheguem ao seu site.
Quer saber se a IA está mesmo citando você?
Uma auditoria do robots.txt diz quais crawlers de IA conseguem chegar ao seu site. O AI Tracker da SEOcrawl AI diz o que eles fazem depois que chegam. Descubra com que frequência o ChatGPT, o Claude, o Gemini e o Perplexity mencionam e citam a sua marca, quais prompts ativam você e como você se compara aos concorrentes que escolher monitorar — tudo junto com os seus dados do Google Search Console no mesmo dashboard.
Perguntas frequentes
O que é um AI bot checker?
Uma ferramenta que lê o seu robots.txt e diz quais crawlers de IA você permite ou bloqueia, um bot de cada vez. Ela compara as suas regras Allow e Disallow com os tokens user-agent das principais empresas de IA: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl e outras.
O que é o GPTBot?
O GPTBot é o crawler web da OpenAI, lançado em agosto de 2023, usado para coletar conteúdo publicamente disponível para treinar os futuros modelos GPT. Não é o mesmo bot que o OAI-SearchBot, que alimenta o ChatGPT Search, nem o ChatGPT-User, que busca uma página quando alguém pede para um assistente ler. Os três obedecem ao robots.txt de forma independente, então você pode permitir um e bloquear outro.
Qual é a diferença entre bots de IA de treinamento, de busca e sob demanda?
Os bots de treinamento (GPTBot, CCBot, Google-Extended, Bytespider) coletam conteúdo para treinar os modelos. Os bots de busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexam o seu site para que ele possa ser citado nas respostas de busca por IA. Os bots de acesso sob demanda (ChatGPT-User, Claude-User, Perplexity-User) buscam uma única página em tempo real quando um usuário pergunta ao assistente sobre ela. Cada um pode ser controlado separadamente no robots.txt.
Como eu bloqueio os crawlers de IA no robots.txt?
Adicione um grupo por crawler com uma regra Disallow. Por exemplo: "User-agent: GPTBot" seguido de "Disallow: /" na linha seguinte. Para bloquear vários, liste cada user-agent no grupo dele. Lembre-se de que o robots.txt é indicativo: crawlers bem-comportados como o GPTBot e o ClaudeBot respeitam, mas ele não vai travar um bot que decidir ignorá-lo.
Devo bloquear ou permitir os bots de IA?
Depende do seu objetivo. Permita os bots de busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) para que a sua marca possa ser citada nas respostas de IA. Bloqueie os bots de treinamento (GPTBot, CCBot, Google-Extended, Bytespider) só se você tiver um motivo específico para recusar. O estudo Rutgers/Wharton concluiu que os publishers que bloquearam os crawlers de IA em bloco perderam 23% do tráfego total, então proibições generalizadas raramente compensam.
O ClaudeBot respeita o robots.txt?
Sim. A documentação oficial da Anthropic confirma que o ClaudeBot, o Claude-User e o Claude-SearchBot respeitam todas as diretivas padrão do robots.txt, incluindo a extensão não padrão Crawl-delay. Cada user-agent pode ser permitido ou bloqueado de forma independente, então você pode recusar o treinamento e continuar citável nas respostas de busca do Claude.
Bloquear o Google-Extended prejudica o meu ranqueamento no Google?
Não. O Google-Extended controla apenas se o seu conteúdo é usado para treinar e embasar o Gemini e o Vertex AI. É um token separado do Googlebot, então bloquear o Google-Extended não tem efeito nenhum sobre como você ranqueia no Google Search. É a forma limpa de recusar o treinamento de IA sem mexer na busca orgânica.
O bloqueio padrão de bots de IA da Cloudflare passa por cima da minha regra Allow no robots.txt?
Sim, o bloqueio no nível da rede prevalece. Desde 1º de julho de 2025, a Cloudflare bloqueia os bots de IA por padrão em todo domínio novo por meio da regra gerenciada "AI Scrapers and Crawlers", mesmo que o seu robots.txt diga Allow. Se um bot aparece como Permitido neste checker mas não consegue buscar as suas páginas de verdade, confira as configurações em Cloudflare Security → Bots.