Semua alat gratis

Pemeriksa Bot AI Robots.txt Gratis: lihat crawler AI mana yang menjangkau situs Anda

Tempel domain atau URL robots.txt Anda. Kami membaca file tersebut, mencocokkan setiap crawler AI besar dengan aturan Allow dan Disallow Anda, lalu memberi tahu Anda bot demi bot mana saja yang menjangkau situs Anda. Tanpa pendaftaran.

Gratis, tanpa pendaftaran. Kami membaca robots.txt Anda dan menunjukkan crawler AI mana — GPTBot, ClaudeBot, Google-Extended, PerplexityBot, dan lainnya — yang saat ini Anda izinkan atau blokir.

Apa yang divalidasi pemeriksa bot AI

  • Putusan per bot (Diizinkan, Sebagian, Diblokir) untuk setiap user-agent AI besar
  • Crawler pelatihan: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
  • Crawler pencarian: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
  • Bot pengambilan sesuai permintaan: ChatGPT-User, Claude-User, Perplexity-User
  • Lokasi URL robots.txt dan kode status HTTP
  • Konflik antara User-agent: * dan aturan khusus bot
  • Jalur yang dilarang per bot — sehingga Anda melihat apa yang disembunyikan, bukan hanya apa yang diblokir

Mengapa robots.txt Anda lebih penting daripada sebelumnya

Robots.txt Anda adalah hal pertama yang dibaca crawler, dan perusahaan AI kini menjalankan beberapa crawler dengan user-agent terpisah. OpenAI sendiri memiliki tiga: GPTBot untuk pelatihan, OAI-SearchBot untuk ChatGPT Search, dan ChatGPT-User untuk pengambilan sesuai permintaan. Anthropic, Google, Perplexity, Common Crawl, dan Meta masing-masing memiliki crawler sendiri.

Keputusan yang Anda buat dalam file ini membentuk dua hasil yang berbeda. Blokir crawler pencarian dan merek Anda lenyap dari jawaban ChatGPT, Claude, dan Perplexity. Biarkan crawler pelatihan terbuka padahal Anda ingin menolak, dan model esok hari belajar dari konten Anda secara gratis.

Sebagian besar situs pada akhirnya menginginkan yang satu dan tidak yang lainnya.

Apa kata data tentang memblokir bot AI

Tiga angka yang layak diketahui sebelum Anda menulis aturannya.

Sebuah studi Rutgers Business School dan Wharton (Januari 2026) melacak penerbit yang memblokir crawler AI melalui robots.txt dan menemukan bahwa total trafik mereka turun rata-rata 23%. Pemblokiran tidak hanya menghentikan botnya; ia juga memutus klik yang dirujuk AI.
Sebuah audit BuzzStream terhadap 100 situs berita teratas menemukan bahwa 79% memblokir setidaknya satu bot pelatihan AI — masuk akal — tetapi 71% juga memblokir setidaknya satu bot pengambilan atau pencarian, biasanya karena kesalahan. Disallow: / menyeluruh menangkap segalanya.
Data milik Cloudflare sendiri menunjukkan lebih dari 1 juta pelanggan telah mengaktifkan tombol “Block AI Scrapers” sekali klik sejak Juli 2024. Sejak 1 Juli 2025, setiap domain baru di Cloudflare hadir dengan bot AI diblokir secara default. Jika robots.txt Anda berkata Allow tetapi bot tetap tidak bisa menjangkau Anda, biasanya inilah penyebabnya.

Cara membaca hasil Anda

Diizinkan

Crawler dapat menjangkau root situs Anda. Untuk bot pencarian seperti OAI-SearchBot, Claude-SearchBot, dan PerplexityBot, inilah yang membuat Anda tetap memenuhi syarat untuk dikutip dalam jawaban AI.

Sebagian

Crawler dapat menjangkau situs Anda, tetapi jalur tertentu dilarang. Biasanya tidak masalah — sebaiknya pastikan Anda tidak menyembunyikan halaman yang ingin ditampilkan dalam pencarian AI.

Diblokir

Aturan Disallow: / menghentikan crawler sepenuhnya. Disengaja untuk menolak pelatihan, tetapi menjadi masalah jika itu crawler pencarian yang Anda ingin tetap terlihat olehnya.

Kesalahan robots.txt paling umum (dan cara memperbaikinya)

Memblokir pencarian AI secara tidak sengaja.

Disallow menyeluruh yang menangkap OAI-SearchBot, Claude-SearchBot, atau PerplexityBot diam-diam menghapus Anda dari jawaban AI.

Perbaikan: Daftarkan crawler pencarian dalam grup User-agent mereka sendiri dan izinkan secara eksplisit.

Menggunakan User-agent: * untuk memblokir AI.

Grup itu juga menangkap Googlebot, Bingbot, dan setiap crawler pencarian biasa, sehingga aturan tersebut memblokir jauh lebih banyak daripada yang Anda maksudkan.

Perbaikan: Sebutkan setiap user-agent AI dalam grupnya sendiri dan biarkan wildcard-nya.

Mengacaukan Google-Extended dengan Googlebot.

Blokir yang salah dan Anda akan membiarkan pelatihan AI tetap aktif atau secara tidak sengaja menghapus diri Anda dari indeks Google Search.

Perbaikan: Gunakan Google-Extended untuk menolak pelatihan Gemini dan Vertex AI; biarkan Googlebot tak tersentuh untuk Penelusuran organik.

Memperlakukan robots.txt sebagai firewall.

Ini bersifat anjuran. Crawler yang berperilaku baik menghormatinya; pelaku jahat dan scraper pihak ketiga mengabaikannya.

Perbaikan: Tambahkan pemblokiran sisi server (aturan AI Cloudflare, WAF, .htaccess) untuk bot yang harus benar-benar Anda hentikan.

Cloudflare menggantikan aturan Allow Anda.

Sejak Juli 2025, Cloudflare memblokir bot AI secara default pada domain baru, terlepas dari apa yang dikatakan robots.txt Anda.

Perbaikan: Buka dasbor Cloudflare, masuk ke Security → Bots → AI Scrapers and Crawlers, dan matikan jika Anda ingin bot pencarian AI menjangkau situs Anda.

Ingin tahu apakah AI benar-benar mengutip Anda?

Audit robots.txt memberi tahu Anda crawler AI mana yang dapat menjangkau situs Anda. SEOcrawl AI Tracker memberi tahu Anda apa yang mereka lakukan setibanya di sana. Pelajari seberapa sering ChatGPT, Claude, Gemini, dan Perplexity menyebut dan mengutip merek Anda, prompt mana yang memicu Anda, dan bagaimana Anda dibandingkan dengan pesaing yang Anda pilih untuk dipantau — berdampingan dengan data Google Search Console Anda di dasbor yang sama.

FAQ

Apa itu pemeriksa bot AI?

Alat yang membaca robots.txt Anda dan memberi tahu Anda crawler AI mana yang Anda izinkan atau blokir, satu bot demi satu bot. Ia membandingkan aturan Allow dan Disallow Anda dengan token user-agent perusahaan AI besar: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl, dan lainnya.

Apa itu GPTBot?

GPTBot adalah crawler web milik OpenAI, diluncurkan pada Agustus 2023, digunakan untuk mengumpulkan konten yang tersedia untuk umum guna melatih model GPT di masa depan. Ini bukan bot yang sama dengan OAI-SearchBot, yang menggerakkan ChatGPT Search, atau ChatGPT-User, yang mengambil sebuah halaman ketika seseorang meminta asisten untuk membacanya. Ketiganya mematuhi robots.txt secara independen, jadi Anda dapat mengizinkan satu dan memblokir yang lain.

Apa perbedaan antara bot AI pelatihan, pencarian, dan sesuai permintaan?

Bot pelatihan (GPTBot, CCBot, Google-Extended, Bytespider) melakukan scraping konten untuk melatih model dasarnya. Bot pencarian (OAI-SearchBot, Claude-SearchBot, PerplexityBot) mengindeks situs Anda agar dapat dikutip dalam jawaban pencarian AI. Bot pengambilan sesuai permintaan (ChatGPT-User, Claude-User, Perplexity-User) mengambil satu halaman secara real time saat pengguna bertanya kepada asisten tentangnya. Masing-masing dapat dikontrol secara terpisah di robots.txt.

Bagaimana cara memblokir crawler AI di robots.txt?

Tambahkan satu grup per crawler dengan aturan Disallow. Misalnya: "User-agent: GPTBot" diikuti "Disallow: /" pada baris berikutnya. Untuk memblokir beberapa, daftarkan setiap user-agent di grupnya sendiri. Ingat bahwa robots.txt bersifat anjuran: crawler yang berperilaku baik seperti GPTBot dan ClaudeBot menghormatinya, tetapi ia tidak akan menghentikan bot yang memilih untuk mengabaikannya.

Haruskah saya memblokir bot AI atau mengizinkannya?

Itu tergantung tujuan Anda. Izinkan bot pencarian (OAI-SearchBot, Claude-SearchBot, PerplexityBot) agar merek Anda dapat dikutip dalam jawaban AI. Blokir bot pelatihan (GPTBot, CCBot, Google-Extended, Bytespider) hanya jika Anda memiliki alasan khusus untuk menolak. Studi Rutgers/Wharton menemukan bahwa penerbit yang memblokir crawler AI secara menyeluruh kehilangan 23% total trafik mereka, jadi larangan menyeluruh jarang menguntungkan.

Apakah ClaudeBot menghormati robots.txt?

Ya. Dokumentasi resmi Anthropic mengonfirmasi bahwa ClaudeBot, Claude-User, dan Claude-SearchBot semuanya menghormati direktif robots.txt standar, termasuk ekstensi non-standar Crawl-delay. Setiap user-agent dapat diizinkan atau diblokir secara independen, jadi Anda dapat menolak pelatihan sambil tetap dapat dikutip dalam jawaban pencarian Claude.

Apakah memblokir Google-Extended merugikan peringkat Google saya?

Tidak. Google-Extended hanya mengontrol apakah konten Anda digunakan untuk melatih dan mendasari Gemini serta Vertex AI. Ini adalah token terpisah dari Googlebot, jadi memblokir Google-Extended tidak berpengaruh terhadap peringkat Anda di Google Search. Ini cara bersih untuk menolak pelatihan AI tanpa menyentuh pencarian organik.

Apakah pemblokiran bot AI default Cloudflare akan menggantikan aturan Allow di robots.txt saya?

Ya, pemblokiran tingkat jaringan menang. Sejak 1 Juli 2025, Cloudflare memblokir bot AI secara default pada setiap domain baru melalui aturan terkelola “AI Scrapers and Crawlers”-nya, meskipun robots.txt Anda berkata Allow. Jika sebuah bot muncul sebagai Diizinkan di pemeriksa ini tetapi sebenarnya tidak dapat mengambil halaman Anda, periksa pengaturan Cloudflare Security → Bots Anda.