Tous les outils gratuits

Vérificateur robots.txt de bots IA gratuit : découvrez quels crawlers IA atteignent votre site

Collez votre domaine ou l'URL de votre robots.txt. Nous lisons le fichier, confrontons chaque grand crawler IA à vos règles Allow et Disallow et vous disons, bot par bot, lesquels atteignent votre site. Sans inscription.

Gratuit, sans inscription. Nous lisons votre robots.txt et vous montrons quels crawlers IA — GPTBot, ClaudeBot, Google-Extended, PerplexityBot et plus — vous autorisez ou bloquez en ce moment.

Ce que le vérificateur de bots IA valide

  • Verdict par bot (Autorisé, Partiel, Bloqué) pour chaque grand user-agent d'IA
  • Crawlers d'entraînement : GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Crawlers de recherche : OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Bots de requête à la demande : ChatGPT-User, Claude-User, Perplexity-User
  • Emplacement du robots.txt (URL) et code de statut HTTP
  • Conflits entre User-agent: * et les règles propres à chaque bot
  • Chemins interdits par bot — pour voir ce que vous masquez, pas seulement ce que vous bloquez

Pourquoi votre robots.txt compte plus qu'avant

Votre robots.txt est la première chose que lit un crawler, et les entreprises d'IA exploitent désormais plusieurs crawlers avec des user-agents distincts. OpenAI à elle seule en a trois : GPTBot pour l'entraînement, OAI-SearchBot pour ChatGPT Search et ChatGPT-User pour les requêtes à la demande. Anthropic, Google, Perplexity, Common Crawl et Meta ont chacun les leurs.

Les décisions que vous prenez dans ce fichier façonnent deux résultats bien différents. Bloquez les crawlers de recherche et votre marque disparaît des réponses de ChatGPT, Claude et Perplexity. Laissez les crawlers d'entraînement ouverts alors que vous vouliez vous en exclure, et les modèles de demain apprennent gratuitement de votre contenu.

La plupart des sites finissent par vouloir l'un sans l'autre.

Ce que disent les données sur le blocage des bots IA

Trois chiffres à connaître avant d'écrire vos règles.

Une étude de la Rutgers Business School et de Wharton (janvier 2026) a suivi des éditeurs qui bloquaient les crawlers IA via robots.txt et a constaté que leur trafic total avait chuté de 23 % en moyenne. Le blocage ne se contente pas d'arrêter les bots ; il coupe aussi les clics référés par l'IA.
Un audit BuzzStream de 100 grands sites d'actualité a révélé que 79 % bloquent au moins un bot d'entraînement IA — ce qui est sensé —, mais 71 % bloquent aussi au moins un bot de récupération ou de recherche, généralement par erreur. Le Disallow: / général attrape tout.
Les données de Cloudflare montrent que plus d'un million de clients ont activé l'interrupteur en un clic « Block AI Scrapers » depuis juillet 2024. Depuis le 1er juillet 2025, chaque nouveau domaine sur Cloudflare arrive avec les bots IA bloqués par défaut. Si votre robots.txt indique Allow mais que les bots ne peuvent toujours pas vous atteindre, c'est généralement la raison.

Comment interpréter votre résultat

Autorisé

Le crawler peut accéder à la racine de votre site. Pour les bots de recherche comme OAI-SearchBot, Claude-SearchBot et PerplexityBot, c'est ce qui vous maintient éligible pour être cité dans les réponses IA.

Partiel

Le crawler peut atteindre votre site, mais certains chemins sont interdits. C'est généralement sans problème : vérifiez simplement que vous ne masquez pas des pages que vous voulez voir apparaître dans la recherche IA.

Bloqué

Une règle Disallow: / arrête totalement le crawler. Intentionnel pour s'exclure de l'entraînement, mais problématique s'il s'agit d'un crawler de recherche pour lequel vous vouliez rester visible.

Les erreurs les plus courantes dans robots.txt (et comment les corriger)

Bloquer la recherche IA par accident.

Un Disallow général qui attrape OAI-SearchBot, Claude-SearchBot ou PerplexityBot vous retire silencieusement des réponses IA.

Correction : Listez les crawlers de recherche dans leurs propres groupes User-agent et autorisez-les explicitement.

Utiliser User-agent: * pour bloquer l'IA.

Ce groupe attrape aussi Googlebot, Bingbot et tous les crawlers de recherche classiques, si bien que la règle bloque bien plus que prévu.

Correction : Nommez chaque user-agent d'IA dans son propre groupe et laissez le joker tranquille.

Confondre Google-Extended et Googlebot.

Bloquez le mauvais et vous laissez l'entraînement IA actif ou vous vous désindexez par mégarde de la recherche Google.

Correction : Utilisez Google-Extended pour vous exclure de l'entraînement de Gemini et Vertex AI ; laissez Googlebot intact pour la recherche organique.

Considérer robots.txt comme un pare-feu.

Il est indicatif. Les crawlers bien élevés le respectent ; les acteurs malveillants et le scraping tiers l'ignorent.

Correction : Ajoutez un blocage côté serveur (règles IA de Cloudflare, WAF, .htaccess) pour les bots que vous devez vraiment stopper.

Laisser Cloudflare écraser votre règle Allow.

Depuis juillet 2025, Cloudflare bloque les bots IA par défaut sur les nouveaux domaines, quoi que dise votre robots.txt.

Correction : Ouvrez le tableau de bord Cloudflare, allez dans Security → Bots → AI Scrapers and Crawlers et désactivez l'option si vous voulez que les bots de recherche IA atteignent votre site.

Vous voulez savoir si l'IA vous cite vraiment ?

Un audit du robots.txt vous dit quels crawlers IA peuvent atteindre votre site. L'AI Tracker de SEOcrawl AI vous dit ce qu'ils font une fois arrivés. Découvrez à quelle fréquence ChatGPT, Claude, Gemini et Perplexity mentionnent et citent votre marque, quels prompts vous déclenchent et comment vous vous situez face aux concurrents que vous choisissez de surveiller — le tout à côté de vos données Google Search Console, sur le même tableau de bord.

Questions fréquentes

Qu'est-ce qu'un vérificateur de bots IA ?

Un outil qui lit votre robots.txt et vous indique quels crawlers IA vous autorisez ou bloquez, bot par bot. Il compare vos règles Allow et Disallow aux tokens de user-agent des principales entreprises d'IA : OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl et d'autres.

Qu'est-ce que GPTBot ?

GPTBot est le crawler web d'OpenAI, lancé en août 2023, utilisé pour collecter du contenu accessible au public afin d'entraîner les futurs modèles GPT. Ce n'est pas le même bot qu'OAI-SearchBot, qui alimente ChatGPT Search, ni que ChatGPT-User, qui récupère une page lorsqu'un utilisateur demande à un assistant de la lire. Les trois obéissent au robots.txt de façon indépendante, vous pouvez donc en autoriser un et en bloquer un autre.

Quelle est la différence entre les bots IA d'entraînement, de recherche et à la demande ?

Les bots d'entraînement (GPTBot, CCBot, Google-Extended, Bytespider) explorent le contenu pour entraîner les modèles sous-jacents. Les bots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexent votre site afin qu'il puisse être cité dans les réponses de recherche IA. Les bots à la demande (ChatGPT-User, Claude-User, Perplexity-User) récupèrent une seule page en temps réel lorsqu'un utilisateur interroge l'assistant à son sujet. Chacun peut être contrôlé séparément dans robots.txt.

Comment bloquer les crawlers IA dans robots.txt ?

Ajoutez un groupe par crawler avec une règle Disallow. Par exemple : "User-agent: GPTBot" suivi de "Disallow: /" sur la ligne suivante. Pour en bloquer plusieurs, listez chaque user-agent dans son propre groupe. Rappelez-vous que robots.txt est indicatif : des crawlers bien élevés comme GPTBot et ClaudeBot le respectent, mais il n'arrêtera pas un bot qui choisit de l'ignorer.

Faut-il bloquer ou autoriser les bots IA ?

Cela dépend de votre objectif. Autorisez les bots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) pour que votre marque puisse être citée dans les réponses IA. Ne bloquez les bots d'entraînement (GPTBot, CCBot, Google-Extended, Bytespider) que si vous avez une raison précise de vous en exclure. L'étude Rutgers/Wharton a constaté que les éditeurs ayant bloqué les crawlers IA de façon indiscriminée ont perdu 23 % de leur trafic total, donc les blocages généralisés paient rarement.

ClaudeBot respecte-t-il le robots.txt ?

Oui. La documentation officielle d'Anthropic confirme que ClaudeBot, Claude-User et Claude-SearchBot respectent tous les directives standard du robots.txt, y compris l'extension non standard Crawl-delay. Chaque user-agent peut être autorisé ou bloqué indépendamment, vous pouvez donc vous exclure de l'entraînement tout en restant citable dans les réponses de recherche de Claude.

Bloquer Google-Extended nuit-il à mon classement Google ?

Non. Google-Extended contrôle uniquement si votre contenu est utilisé pour entraîner et ancrer Gemini et Vertex AI. C'est un token distinct de Googlebot, donc bloquer Google-Extended n'a aucun effet sur votre classement dans la recherche Google. C'est la façon propre de vous exclure de l'entraînement IA sans toucher à la recherche organique.

Le blocage par défaut des bots IA de Cloudflare écrase-t-il ma règle Allow du robots.txt ?

Oui, le blocage au niveau du réseau l'emporte. Depuis le 1er juillet 2025, Cloudflare bloque les bots IA par défaut sur chaque nouveau domaine via sa règle gérée "AI Scrapers and Crawlers", même si votre robots.txt dit Allow. Si un bot apparaît comme Autorisé dans ce vérificateur mais ne peut pas réellement récupérer vos pages, vérifiez vos paramètres Cloudflare dans Security → Bots.