Totes les eines gratis

Verificador robots.txt de bots IA gratis: descobreix quins crawlers d'IA arriben al teu lloc

Enganxa el teu domini o la URL del teu robots.txt. Llegim el fitxer, comparem cada gran crawler d'IA amb les teves regles Allow i Disallow i et diem, bot a bot, quins arriben al teu lloc. Sense registre.

Gratis i sense registre. Llegim el teu robots.txt i et mostrem quins crawlers d'IA —GPTBot, ClaudeBot, Google-Extended, PerplexityBot i més— permets o bloqueges en aquest moment.

Què valida el verificador de bots IA

  • Veredicte per bot (Permès, Parcial, Bloquejat) per a cada gran user-agent d'IA
  • Crawlers d'entrenament: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Crawlers de cerca: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Bots de petició puntual: ChatGPT-User, Claude-User, Perplexity-User
  • Ubicació del robots.txt (URL) i codi d'estat HTTP
  • Conflictes entre User-agent: * i les regles específiques de cada bot
  • Rutes bloquejades per bot — perquè vegis què amagues, no només què bloqueges

Per què el teu robots.txt importa més que mai

El teu robots.txt és el primer que llegeix un crawler, i les empreses d'IA ja operen diversos crawlers amb user-agents diferents. Només OpenAI en té tres: GPTBot per a l'entrenament, OAI-SearchBot per a ChatGPT Search i ChatGPT-User per a peticions puntuals. Anthropic, Google, Perplexity, Common Crawl i Meta tenen els seus.

Les decisions que prenguis en aquest fitxer determinen dos resultats ben diferents. Bloqueja els crawlers de cerca i la teva marca desapareix de les respostes de ChatGPT, Claude i Perplexity. Deixa oberts els crawlers d'entrenament quan volies excloure't i els models de demà aprenen del teu contingut de franc.

La majoria dels llocs acaben volent l'una cosa i no l'altra.

Què diuen les dades sobre bloquejar bots d'IA

Tres xifres que val la pena conèixer abans d'escriure les regles.

Un estudi de Rutgers Business School i Wharton (gener de 2026) va seguir editors que van bloquejar crawlers d'IA via robots.txt i va trobar que el seu trànsit total va caure un 23% de mitjana. El bloqueig no només atura els bots; també talla els clics referits per la IA.
Una auditoria de BuzzStream sobre 100 grans llocs de notícies va trobar que el 79% bloqueja almenys un bot d'entrenament d'IA —el més assenyat—, però el 71% també bloqueja almenys un bot de recuperació o de cerca, normalment per error. El Disallow: / general ho atrapa tot.
Les mateixes dades de Cloudflare mostren que més d'1 milió de clients han activat l'interruptor d'un clic “Block AI Scrapers” des del juliol de 2024. Des de l'1 de juliol de 2025, cada domini nou a Cloudflare arriba amb els bots d'IA bloquejats per defecte. Si el teu robots.txt diu Allow però els bots encara no poden arribar, aquesta sol ser la raó.

Com interpretar el teu resultat

Permès

El crawler pot accedir a l'arrel del teu lloc. Per als bots de cerca com OAI-SearchBot, Claude-SearchBot i PerplexityBot, això és el que et manté elegible per ser citat a les respostes d'IA.

Parcial

El crawler pot arribar al teu lloc, però hi ha rutes concretes bloquejades. Sol estar bé: val la pena confirmar que no estàs amagant pàgines que vols que apareguin a la cerca amb IA.

Bloquejat

Una regla Disallow: / atura el crawler del tot. És intencionat si t'exclous de l'entrenament, però un problema si és un crawler de cerca amb el qual volies continuar essent visible.

Els errors més habituals al robots.txt (i com solucionar-los)

Bloquejar la cerca amb IA sense voler.

Un Disallow genèric que atrapa OAI-SearchBot, Claude-SearchBot o PerplexityBot t'elimina en silenci de les respostes d'IA.

Solució: Llista els crawlers de cerca als seus propis grups User-agent i permet-los l'accés explícitament.

Fer servir User-agent: * per bloquejar la IA.

Aquest grup també atrapa Googlebot, Bingbot i tots els crawlers de cerca habituals, així que la regla bloqueja molt més del que pretenies.

Solució: Anomena cada user-agent d'IA al seu propi grup i deixa el comodí en pau.

Confondre Google-Extended amb Googlebot.

Bloqueja l'equivocat i o bé deixes actiu l'entrenament d'IA o et desindexes sense voler de la Cerca de Google.

Solució: Fes servir Google-Extended per excloure't de l'entrenament de Gemini i Vertex AI; deixa Googlebot intacte per a la Cerca orgànica.

Tractar robots.txt com un tallafocs.

És orientatiu. Els crawlers que es comporten bé el respecten; els mals actors i l'scraping de tercers l'ignoren.

Solució: Afegeix bloqueig al servidor (regles d'IA de Cloudflare, WAF, .htaccess) per als bots que hagis d'aturar de debò.

Que Cloudflare anul·li la teva regla Allow.

Des del juliol de 2025, Cloudflare bloqueja els bots d'IA per defecte als dominis nous, al marge del que digui el teu robots.txt.

Solució: Obre el panell de Cloudflare, ves a Security → Bots → AI Scrapers and Crawlers i desactiva-ho si vols que els bots de cerca amb IA arribin al teu lloc.

Vols saber si la IA t'està citant de veritat?

Una auditoria de robots.txt et diu quins crawlers d'IA poden arribar al teu lloc. L'AI Tracker de SEOcrawl AI et diu què fan un cop hi són. Descobreix amb quina freqüència ChatGPT, Claude, Gemini i Perplexity esmenten i citen la teva marca, quins prompts t'activen i com et compares amb els competidors que triïs monitorar, tot al costat de les teves dades de Google Search Console al mateix panell.

Preguntes freqüents

Què és un verificador de bots d'IA?

Una eina que llegeix el teu robots.txt i t'indica quins crawlers d'IA permets o bloqueges, bot a bot. Compara les teves regles Allow i Disallow amb els tokens de user-agent de les principals empreses d'IA: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl i d'altres.

Què és GPTBot?

GPTBot és el crawler web d'OpenAI, llançat l'agost de 2023, que s'utilitza per recopilar contingut d'accés públic amb què entrenar els futurs models GPT. No és el mateix bot que OAI-SearchBot, que impulsa ChatGPT Search, ni que ChatGPT-User, que recupera una pàgina quan algú demana a un assistent que la llegeixi. Tots tres obeeixen el robots.txt de manera independent, així que en pots permetre un i bloquejar-ne un altre.

Quina diferència hi ha entre els bots d'IA d'entrenament, de cerca i de petició puntual?

Els bots d'entrenament (GPTBot, CCBot, Google-Extended, Bytespider) rastregen contingut per entrenar els models subjacents. Els bots de cerca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexen el teu lloc perquè es pugui citar a les respostes de cerca amb IA. Els bots de petició puntual (ChatGPT-User, Claude-User, Perplexity-User) recuperen una sola pàgina en temps real quan un usuari pregunta a l'assistent per ella. Cadascun es pot controlar per separat al robots.txt.

Com bloquejo els crawlers d'IA al robots.txt?

Afegeix un grup per crawler amb una regla Disallow. Per exemple: "User-agent: GPTBot" seguit de "Disallow: /" a la línia següent. Per bloquejar-ne diversos, llista cada user-agent al seu propi grup. Recorda que robots.txt és orientatiu: els crawlers que es comporten bé com GPTBot i ClaudeBot el respecten, però no aturarà un bot que decideixi ignorar-lo.

He de bloquejar o permetre els bots d'IA?

Depèn del teu objectiu. Permet els bots de cerca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) perquè la teva marca es pugui citar a les respostes d'IA. Bloqueja els bots d'entrenament (GPTBot, CCBot, Google-Extended, Bytespider) només si tens un motiu concret per excloure't. L'estudi de Rutgers/Wharton va trobar que els editors que van bloquejar els crawlers d'IA de manera indiscriminada van perdre un 23% del seu trànsit total, així que els bloquejos totals rarament compensen.

ClaudeBot respecta el robots.txt?

Sí. La documentació oficial d'Anthropic confirma que ClaudeBot, Claude-User i Claude-SearchBot respecten les directives estàndard de robots.txt, inclosa l'extensió no estàndard Crawl-delay. Cada user-agent es pot permetre o bloquejar de manera independent, així que pots excloure't de l'entrenament i continuar essent citable a les respostes de cerca de Claude.

Bloquejar Google-Extended perjudica el meu posicionament a Google?

No. Google-Extended només controla si el teu contingut s'utilitza per entrenar i fonamentar Gemini i Vertex AI. És un token independent de Googlebot, així que bloquejar Google-Extended no afecta gens com et poses a la Cerca de Google. És la manera neta d'excloure't de l'entrenament d'IA sense tocar la cerca orgànica.

El bloqueig de bots d'IA per defecte de Cloudflare anul·la la meva regla Allow del robots.txt?

Sí, el bloqueig a nivell de xarxa guanya. Des de l'1 de juliol de 2025, Cloudflare bloqueja els bots d'IA per defecte a cada domini nou mitjançant la seva regla gestionada "AI Scrapers and Crawlers", encara que el teu robots.txt digui Allow. Si un bot apareix com a Permès en aquest verificador però no pot arribar a les teves pàgines, revisa la configuració de Cloudflare a Security → Bots.