Усі безкоштовні інструменти

Безкоштовна перевірка AI-ботів у robots.txt: дізнайтеся, які AI-краулери дістаються вашого сайту

Вставте свій домен або URL robots.txt. Ми зчитуємо файл, звіряємо кожен основний AI-краулер із вашими правилами Allow і Disallow й повідомляємо, бот за ботом, які з них дістаються вашого сайту. Реєстрація не потрібна.

Безкоштовно, без реєстрації. Ми зчитуємо ваш robots.txt і показуємо, яким AI-краулерам — GPTBot, ClaudeBot, Google-Extended, PerplexityBot та іншим — ви наразі дозволяєте чи блокуєте доступ.

Що перевіряє перевірка AI-ботів

  • Вердикт по кожному боту (Дозволено, Частково, Заблоковано) для кожного основного AI user-agent
  • Навчальні краулери: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Пошукові краулери: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Боти отримання на вимогу: ChatGPT-User, Claude-User, Perplexity-User
  • Розташування URL robots.txt і код стану HTTP
  • Конфлікти між User-agent: * і правилами для конкретних ботів
  • Заборонені шляхи для кожного бота — щоб ви бачили не лише те, що заблоковано, а й що приховано

Чому ваш robots.txt важить більше, ніж раніше

Ваш robots.txt — це перше, що зчитує краулер, і AI-компанії тепер запускають кілька краулерів з окремими user-agent. Лише в OpenAI їх три: GPTBot для навчання, OAI-SearchBot для ChatGPT Search і ChatGPT-User для запитів на вимогу. Anthropic, Google, Perplexity, Common Crawl і Meta мають кожен свої.

Рішення, які ви ухвалюєте в цьому файлі, визначають два різні результати. Заблокуйте пошукові краулери — і ваш бренд зникне з відповідей ChatGPT, Claude та Perplexity. Залишіть навчальні краулери відкритими, коли хотіли відмовитися, — і завтрашні моделі безкоштовно навчатимуться на вашому контенті.

Більшість сайтів зрештою хочуть одне й не хочуть іншого.

Що кажуть дані про блокування AI-ботів

Три числа, які варто знати, перш ніж писати правила.

Дослідження Rutgers Business School і Wharton (січень 2026) відстежувало видавців, які блокували AI-краулери через robots.txt, і виявило, що їхній сукупний трафік упав у середньому на 23%. Блокування не лише зупиняє ботів; воно відрізає і кліки, отримані через AI.
Аудит BuzzStream 100 провідних новинних сайтів виявив, що 79% блокують принаймні одного AI-бота навчання — це розумно, — але 71% також блокують принаймні одного бота отримання чи пошуку, зазвичай помилково. Суцільний Disallow: / зачіпає все.
Власні дані Cloudflare показують, що понад 1 мільйон клієнтів увімкнули перемикач «Block AI Scrapers» в один клік із липня 2024 року. Із 1 липня 2025 року кожен новий домен на Cloudflare постачається з AI-ботами, заблокованими за замовчуванням. Якщо ваш robots.txt каже Allow, але боти все одно не можуть до вас дістатися, зазвичай причина саме в цьому.

Як читати ваш результат

Дозволено

Краулер може дістатися кореня вашого сайту. Для пошукових ботів, як-от OAI-SearchBot, Claude-SearchBot та PerplexityBot, саме це дозволяє вам залишатися придатними для цитування в AI-відповідях.

Частково

Краулер може дістатися вашого сайту, але окремі шляхи заборонені. Зазвичай це нормально — варто переконатися, що ви не приховуєте сторінки, які хочете показувати в AI-пошуку.

Заблоковано

Правило Disallow: / повністю зупиняє краулер. Це навмисно для відмови від навчання, але проблема, якщо це пошуковий краулер, для якого ви хотіли залишатися видимими.

Найпоширеніші помилки в robots.txt (і як їх виправити)

Випадкове блокування AI-пошуку.

Суцільний Disallow, що зачіпає OAI-SearchBot, Claude-SearchBot чи PerplexityBot, тихо вилучає вас із AI-відповідей.

Виправлення: Перелічіть пошукові краулери в їхніх власних групах User-agent і дозвольте їх явно.

Використання User-agent: * для блокування AI.

Ця група також зачіпає Googlebot, Bingbot і кожен звичайний пошуковий краулер, тож правило блокує набагато більше, ніж ви задумали.

Виправлення: Назвіть кожен AI user-agent у його власній групі й не чіпайте підстановку.

Плутанина між Google-Extended і Googlebot.

Заблокуєте не той — і ви або залишите AI-навчання ввімкненим, або випадково деіндексуєте себе з Google Search.

Виправлення: Використовуйте Google-Extended, щоб відмовитися від навчання Gemini та Vertex AI; залиште Googlebot недоторканим для органічного Пошуку.

Сприйняття robots.txt як фаєрволу.

Він має рекомендаційний характер. Добропорядні краулери його дотримуються; зловмисники та сторонні скрейпери ігнорують.

Виправлення: Додайте блокування на стороні сервера (правила Cloudflare для AI, WAF, .htaccess) для ботів, яких потрібно зупинити жорстко.

Cloudflare перекриває ваше правило Allow.

Із липня 2025 року Cloudflare блокує AI-ботів за замовчуванням на нових доменах, незалежно від того, що каже ваш robots.txt.

Виправлення: Відкрийте панель Cloudflare, перейдіть до Security → Bots → AI Scrapers and Crawlers і вимкніть це, якщо хочете, щоб AI-пошукові боти дісталися вашого сайту.

Хочете дізнатися, чи AI справді цитує вас?

Аудит robots.txt показує, які AI-краулери можуть дістатися вашого сайту. AI Tracker від SEOcrawl AI показує, що вони роблять, коли вже там. Дізнайтеся, як часто ChatGPT, Claude, Gemini та Perplexity згадують і цитують ваш бренд, які запити вас активують і як ви виглядаєте на тлі конкурентів, яких ви обираєте для моніторингу, — і все це поряд із даними Google Search Console на одній панелі.

Поширені запитання

Що таке перевірка AI-ботів?

Інструмент, який зчитує ваш robots.txt і повідомляє, які AI-краулери ви дозволяєте чи блокуєте, бот за ботом. Він звіряє ваші правила Allow і Disallow із токенами user-agent основних AI-компаній: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl та інших.

Що таке GPTBot?

GPTBot — це вебкраулер OpenAI, запущений у серпні 2023 року, який збирає загальнодоступний контент для навчання майбутніх моделей GPT. Це не той самий бот, що OAI-SearchBot, який живить ChatGPT Search, чи ChatGPT-User, який завантажує сторінку, коли хтось просить асистента її прочитати. Усі троє дотримуються robots.txt незалежно, тож ви можете одного дозволити, а іншого заблокувати.

Яка різниця між навчальними, пошуковими та on-demand AI-ботами?

Навчальні боти (GPTBot, CCBot, Google-Extended, Bytespider) збирають контент для навчання базових моделей. Пошукові боти (OAI-SearchBot, Claude-SearchBot, PerplexityBot) індексують ваш сайт, щоб його можна було цитувати у відповідях AI-пошуку. Боти отримання на вимогу (ChatGPT-User, Claude-User, Perplexity-User) забирають одну сторінку в реальному часі, коли користувач запитує про неї асистента. Кожним із них можна керувати окремо в robots.txt.

Як заблокувати AI-краулери в robots.txt?

Додайте одну групу для кожного краулера з правилом Disallow. Наприклад: "User-agent: GPTBot", а наступним рядком "Disallow: /". Щоб заблокувати кількох, перелічіть кожен user-agent у власній групі. Пам'ятайте, що robots.txt має рекомендаційний характер: добропорядні краулери, як-от GPTBot та ClaudeBot, його дотримуються, але він не зупинить бота, який вирішить його ігнорувати.

Блокувати AI-ботів чи дозволяти їх?

Це залежить від вашої мети. Дозвольте пошукові боти (OAI-SearchBot, Claude-SearchBot, PerplexityBot), щоб ваш бренд міг бути цитований у AI-відповідях. Навчальні боти (GPTBot, CCBot, Google-Extended, Bytespider) блокуйте лише тоді, коли маєте конкретну причину відмовитися. Дослідження Rutgers/Wharton виявило, що видавці, які суцільно блокували AI-краулери, втратили 23% свого загального трафіку, тож тотальні заборони рідко себе виправдовують.

Чи дотримується ClaudeBot robots.txt?

Так. Офіційна документація Anthropic підтверджує, що ClaudeBot, Claude-User і Claude-SearchBot дотримуються стандартних директив robots.txt, включно з нестандартним розширенням Crawl-delay. Кожного user-agent можна дозволити чи заблокувати окремо, тож ви можете відмовитися від навчання, залишаючись придатними для цитування у пошукових відповідях Claude.

Чи зашкодить блокування Google-Extended моїм позиціям у Google?

Ні. Google-Extended лише контролює, чи використовується ваш контент для навчання та обґрунтування Gemini й Vertex AI. Це окремий токен від Googlebot, тож блокування Google-Extended не впливає на те, як ви ранжуєтеся в Google Search. Це чистий спосіб відмовитися від AI-навчання, не зачіпаючи органічний пошук.

Чи перекриє типове блокування AI-ботів у Cloudflare моє правило Allow в robots.txt?

Так, блокування на рівні мережі перемагає. Із 1 липня 2025 року Cloudflare за замовчуванням блокує AI-ботів на кожному новому домені через кероване правило «AI Scrapers and Crawlers», навіть якщо ваш robots.txt каже Allow. Якщо бот у цій перевірці показується як Дозволений, але насправді не може завантажити ваші сторінки, перевірте налаштування Cloudflare Security → Bots.