Verificador robots.txt de bots IA gratis: descubre qué crawlers de IA llegan a tu sitio
Pega tu dominio o la URL de tu robots.txt. Leemos el archivo, cotejamos cada gran crawler de IA con tus reglas Allow y Disallow y te decimos, bot a bot, cuáles llegan a tu sitio. Sin registro.
Gratis y sin registro. Leemos tu robots.txt y te mostramos qué crawlers de IA —GPTBot, ClaudeBot, Google-Extended, PerplexityBot y más— permites o bloqueas en este momento.
Qué valida el verificador de bots IA
- Veredicto por bot (Permitido, Parcial, Bloqueado) para cada gran user-agent de IA
- Crawlers de entrenamiento: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
- Crawlers de búsqueda: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
- Bots de petición puntual: ChatGPT-User, Claude-User, Perplexity-User
- Ubicación del robots.txt (URL) y código de estado HTTP
- Conflictos entre User-agent: * y las reglas específicas de cada bot
- Rutas bloqueadas por bot — para que veas qué ocultas, no solo qué bloqueas
Por qué tu robots.txt importa más que nunca
Tu robots.txt es lo primero que lee un crawler, y las empresas de IA operan ya varios crawlers con user-agents distintos. Solo OpenAI tiene tres: GPTBot para entrenamiento, OAI-SearchBot para ChatGPT Search y ChatGPT-User para peticiones puntuales. Anthropic, Google, Perplexity, Common Crawl y Meta tienen los suyos.
Las decisiones que tomes en este archivo determinan dos resultados muy distintos. Bloquea los crawlers de búsqueda y tu marca desaparece de las respuestas de ChatGPT, Claude y Perplexity. Deja abiertos los crawlers de entrenamiento cuando querías excluirte y los modelos del mañana aprenden de tu contenido gratis.
La mayoría de los sitios acaban queriendo lo uno y no lo otro.
Qué dicen los datos sobre bloquear bots de IA
Tres cifras que conviene conocer antes de escribir las reglas.
Cómo interpretar tu resultado
Permitido
El crawler puede acceder a la raíz de tu sitio. Para bots de búsqueda como OAI-SearchBot, Claude-SearchBot y PerplexityBot, esto es lo que te mantiene elegible para ser citado en las respuestas de IA.
Parcial
El crawler puede llegar a tu sitio, pero hay rutas concretas bloqueadas. Suele estar bien: conviene confirmar que no estás ocultando páginas que quieres que aparezcan en la búsqueda con IA.
Bloqueado
Una regla Disallow: / detiene al crawler por completo. Es intencionado si te excluyes del entrenamiento, pero un problema si es un crawler de búsqueda con el que querías seguir siendo visible.
Los errores más habituales en robots.txt (y cómo solucionarlos)
Bloquear la búsqueda con IA sin querer.
Un Disallow genérico que atrapa a OAI-SearchBot, Claude-SearchBot o PerplexityBot te elimina en silencio de las respuestas de IA.
Solución: Lista los crawlers de búsqueda en sus propios grupos User-agent y permíteles el acceso explícitamente.
Usar User-agent: * para bloquear la IA.
Ese grupo también atrapa a Googlebot, Bingbot y a todos los crawlers de búsqueda habituales, así que la regla bloquea mucho más de lo que pretendías.
Solución: Nombra cada user-agent de IA en su propio grupo y deja el comodín en paz.
Confundir Google-Extended con Googlebot.
Bloquea el equivocado y o bien dejas activo el entrenamiento de IA o te desindexas sin querer de la Búsqueda de Google.
Solución: Usa Google-Extended para excluirte del entrenamiento de Gemini y Vertex AI; deja Googlebot intacto para la Búsqueda orgánica.
Tratar robots.txt como un cortafuegos.
Es orientativo. Los crawlers que se comportan bien lo respetan; los malos actores y el scraping de terceros lo ignoran.
Solución: Añade bloqueo en el servidor (reglas de IA de Cloudflare, WAF, .htaccess) para los bots que debas frenar de verdad.
Que Cloudflare anule tu regla Allow.
Desde julio de 2025, Cloudflare bloquea los bots de IA por defecto en los dominios nuevos, al margen de lo que diga tu robots.txt.
Solución: Abre el panel de Cloudflare, ve a Security → Bots → AI Scrapers and Crawlers y desactívalo si quieres que los bots de búsqueda con IA lleguen a tu sitio.
¿Quieres saber si la IA te está citando de verdad?
Una auditoría de robots.txt te dice qué crawlers de IA pueden llegar a tu sitio. El AI Tracker de SEOcrawl AI te dice qué hacen una vez dentro. Descubre con qué frecuencia ChatGPT, Claude, Gemini y Perplexity mencionan y citan tu marca, qué prompts te activan y cómo te comparas con los competidores que elijas monitorizar, todo junto a tus datos de Google Search Console en el mismo panel.
Preguntas frecuentes
¿Qué es un verificador de bots de IA?
Una herramienta que lee tu robots.txt y te dice qué crawlers de IA permites o bloqueas, bot a bot. Compara tus reglas Allow y Disallow con los tokens de user-agent de las principales empresas de IA: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl y otras.
¿Qué es GPTBot?
GPTBot es el crawler web de OpenAI, lanzado en agosto de 2023, que se usa para recopilar contenido de acceso público con el que entrenar los futuros modelos GPT. No es el mismo bot que OAI-SearchBot, que impulsa ChatGPT Search, ni que ChatGPT-User, que recupera una página cuando alguien le pide a un asistente que la lea. Los tres obedecen robots.txt de forma independiente, así que puedes permitir a uno y bloquear a otro.
¿Qué diferencia hay entre los bots de IA de entrenamiento, de búsqueda y de petición puntual?
Los bots de entrenamiento (GPTBot, CCBot, Google-Extended, Bytespider) rastrean contenido para entrenar los modelos subyacentes. Los bots de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexan tu sitio para que pueda citarse en las respuestas de búsqueda con IA. Los bots de petición puntual (ChatGPT-User, Claude-User, Perplexity-User) recuperan una sola página en tiempo real cuando un usuario le pregunta al asistente por ella. Cada uno puede controlarse por separado en robots.txt.
¿Cómo bloqueo a los crawlers de IA en robots.txt?
Añade un grupo por crawler con una regla Disallow. Por ejemplo: "User-agent: GPTBot" seguido de "Disallow: /" en la línea siguiente. Para bloquear varios, lista cada user-agent en su propio grupo. Recuerda que robots.txt es orientativo: los crawlers que se comportan bien como GPTBot y ClaudeBot lo respetan, pero no detendrá a un bot que decida ignorarlo.
¿Debo bloquear o permitir a los bots de IA?
Depende de tu objetivo. Permite los bots de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) para que tu marca pueda citarse en las respuestas de IA. Bloquea los bots de entrenamiento (GPTBot, CCBot, Google-Extended, Bytespider) solo si tienes un motivo concreto para excluirte. El estudio de Rutgers/Wharton halló que los editores que bloquearon los crawlers de IA de forma indiscriminada perdieron un 23% de su tráfico total, así que los bloqueos totales rara vez compensan.
¿ClaudeBot respeta el robots.txt?
Sí. La documentación oficial de Anthropic confirma que ClaudeBot, Claude-User y Claude-SearchBot respetan las directivas estándar de robots.txt, incluida la extensión no estándar Crawl-delay. Cada user-agent puede permitirse o bloquearse de forma independiente, así que puedes excluirte del entrenamiento y seguir siendo citable en las respuestas de búsqueda de Claude.
¿Bloquear Google-Extended perjudica mi posicionamiento en Google?
No. Google-Extended solo controla si tu contenido se usa para entrenar y fundamentar Gemini y Vertex AI. Es un token independiente de Googlebot, así que bloquear Google-Extended no afecta en absoluto a cómo posicionas en la Búsqueda de Google. Es la forma limpia de excluirte del entrenamiento de IA sin tocar la búsqueda orgánica.
¿El bloqueo de bots de IA por defecto de Cloudflare anula mi regla Allow del robots.txt?
Sí, el bloqueo a nivel de red gana. Desde el 1 de julio de 2025, Cloudflare bloquea los bots de IA por defecto en cada dominio nuevo mediante su regla gestionada "AI Scrapers and Crawlers", aunque tu robots.txt diga Allow. Si un bot aparece como Permitido en este verificador pero no puede llegar a tus páginas, revisa la configuración de Cloudflare en Security → Bots.





