Kiểm tra Bot AI trong Robots.txt miễn phí: xem những trình thu thập AI nào tiếp cận được trang của bạn
Dán tên miền hoặc URL robots.txt của bạn. Chúng tôi đọc tệp, đối chiếu mọi trình thu thập AI lớn với các quy tắc Allow và Disallow của bạn, rồi cho biết theo từng bot những bot nào tiếp cận được trang của bạn. Không cần đăng ký.
Miễn phí, không cần đăng ký. Chúng tôi đọc robots.txt của bạn và cho biết những trình thu thập AI nào — GPTBot, ClaudeBot, Google-Extended, PerplexityBot và nhiều hơn nữa — bạn đang cho phép hoặc chặn.
Công cụ kiểm tra bot AI xác thực những gì
- Kết luận theo từng bot (Được phép, Một phần, Bị chặn) cho mọi user-agent AI lớn
- Trình thu thập huấn luyện: GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Meta-ExternalAgent
- Trình thu thập tìm kiếm: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot-Extended
- Bot truy xuất theo yêu cầu: ChatGPT-User, Claude-User, Perplexity-User
- Vị trí URL của robots.txt và mã trạng thái HTTP
- Xung đột giữa User-agent: * và các quy tắc dành riêng cho từng bot
- Các đường dẫn bị Disallow theo từng bot — để bạn thấy được điều gì đang bị ẩn, không chỉ điều gì bị chặn
Vì sao robots.txt của bạn nay quan trọng hơn trước
robots.txt là thứ đầu tiên mà một trình thu thập đọc, và các công ty AI hiện vận hành nhiều trình thu thập với các user-agent riêng biệt. Chỉ riêng OpenAI đã có ba: GPTBot để huấn luyện, OAI-SearchBot cho ChatGPT Search, và ChatGPT-User cho các lượt truy xuất theo yêu cầu. Anthropic, Google, Perplexity, Common Crawl và Meta mỗi bên đều có bot riêng.
Những quyết định bạn đưa ra trong tệp này định hình hai kết quả khác nhau. Chặn các trình thu thập tìm kiếm thì thương hiệu của bạn biến mất khỏi câu trả lời của ChatGPT, Claude và Perplexity. Để mở các trình thu thập huấn luyện trong khi bạn muốn từ chối thì các mô hình của ngày mai học từ nội dung của bạn miễn phí.
Hầu hết các trang web cuối cùng đều muốn cái này mà không muốn cái kia.
Dữ liệu nói gì về việc chặn bot AI
Ba con số đáng biết trước khi bạn viết các quy tắc.
Cách đọc kết quả của bạn
Được phép
Trình thu thập có thể truy cập gốc website của bạn. Với các bot tìm kiếm như OAI-SearchBot, Claude-SearchBot và PerplexityBot, đây là điều giữ cho bạn đủ điều kiện được trích dẫn trong câu trả lời AI.
Một phần
Trình thu thập có thể truy cập website của bạn nhưng một số đường dẫn cụ thể bị Disallow. Thường thì không sao — nên xác nhận bạn không ẩn những trang mình muốn xuất hiện trong tìm kiếm AI.
Bị chặn
Một quy tắc Disallow: / chặn hoàn toàn trình thu thập này. Có chủ đích nếu bạn muốn từ chối huấn luyện, nhưng là vấn đề nếu đó là trình thu thập tìm kiếm mà bạn muốn vẫn hiển thị.
Những lỗi robots.txt thường gặp nhất (và cách khắc phục)
Vô tình chặn tìm kiếm AI.
Một lệnh Disallow bao trùm vô tình cuốn theo OAI-SearchBot, Claude-SearchBot hoặc PerplexityBot sẽ âm thầm loại bạn khỏi câu trả lời AI.
Cách khắc phục: Liệt kê các trình thu thập tìm kiếm trong nhóm User-agent riêng của chúng và cho phép chúng một cách rõ ràng.
Dùng User-agent: * để chặn AI.
Nhóm đó cũng cuốn theo Googlebot, Bingbot và mọi trình thu thập tìm kiếm thông thường, nên quy tắc này chặn nhiều hơn hẳn so với ý định của bạn.
Cách khắc phục: Nêu tên từng user-agent AI trong nhóm riêng của nó và để yên nhóm ký tự đại diện.
Nhầm lẫn Google-Extended với Googlebot.
Chặn nhầm bot thì hoặc bạn vẫn để huấn luyện AI bật, hoặc vô tình gỡ chính mình khỏi chỉ mục Google Search.
Cách khắc phục: Dùng Google-Extended để từ chối huấn luyện Gemini và Vertex AI; để yên Googlebot cho Tìm kiếm tự nhiên.
Coi robots.txt như một tường lửa.
Nó chỉ mang tính khuyến nghị. Các trình thu thập có hành vi tốt tôn trọng nó; kẻ xấu và các bên thu thập thứ ba thì phớt lờ.
Cách khắc phục: Thêm cách chặn phía máy chủ (quy tắc AI của Cloudflare, WAF, .htaccess) cho những bot bạn buộc phải chặn triệt để.
Cloudflare ghi đè quy tắc Allow của bạn.
Kể từ tháng 7 năm 2025, Cloudflare mặc định chặn bot AI trên các tên miền mới, bất kể robots.txt của bạn ghi gì.
Cách khắc phục: Mở bảng điều khiển Cloudflare, vào Security → Bots → AI Scrapers and Crawlers, và tắt nó đi nếu bạn muốn các bot tìm kiếm AI tiếp cận được trang của bạn.
Muốn biết AI có thực sự trích dẫn bạn không?
Một lần kiểm tra robots.txt cho biết những trình thu thập AI nào tiếp cận được trang của bạn. AI Tracker của SEOcrawl AI cho biết chúng làm gì khi đã vào được đó. Tìm hiểu ChatGPT, Claude, Gemini và Perplexity nhắc đến và trích dẫn thương hiệu của bạn thường xuyên ra sao, những prompt nào kích hoạt bạn, và bạn so ra sao với các đối thủ mà bạn chọn để giám sát — tất cả đặt cạnh dữ liệu Google Search Console của bạn trên cùng một bảng điều khiển.
Câu hỏi thường gặp
Công cụ kiểm tra bot AI là gì?
Một công cụ đọc robots.txt của bạn và cho biết bạn đang cho phép hay chặn những trình thu thập AI nào, theo từng bot. Nó đối chiếu các quy tắc Allow và Disallow của bạn với token user-agent của các công ty AI lớn: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic (ClaudeBot, Claude-SearchBot, Claude-User), Google (Google-Extended), Perplexity (PerplexityBot), Meta, Common Crawl và những bên khác.
GPTBot là gì?
GPTBot là trình thu thập web của OpenAI, ra mắt vào tháng 8 năm 2023, dùng để thu thập nội dung công khai nhằm huấn luyện các mô hình GPT trong tương lai. Nó không phải là bot giống với OAI-SearchBot, vốn vận hành ChatGPT Search, hay ChatGPT-User, vốn tải về một trang khi ai đó yêu cầu trợ lý đọc trang đó. Cả ba đều tuân theo robots.txt một cách độc lập, nên bạn có thể cho phép một bot và chặn một bot khác.
Sự khác nhau giữa bot AI huấn luyện, tìm kiếm và truy xuất theo yêu cầu là gì?
Bot huấn luyện (GPTBot, CCBot, Google-Extended, Bytespider) thu thập nội dung để huấn luyện các mô hình nền tảng. Bot tìm kiếm (OAI-SearchBot, Claude-SearchBot, PerplexityBot) lập chỉ mục website của bạn để nó có thể được trích dẫn trong câu trả lời tìm kiếm AI. Bot truy xuất theo yêu cầu (ChatGPT-User, Claude-User, Perplexity-User) lấy về một trang theo thời gian thực khi người dùng hỏi trợ lý về trang đó. Mỗi loại có thể được kiểm soát riêng biệt trong robots.txt.
Làm sao để chặn trình thu thập AI trong robots.txt?
Thêm một nhóm cho mỗi trình thu thập kèm quy tắc Disallow. Ví dụ: "User-agent: GPTBot" theo sau là "Disallow: /" ở dòng tiếp theo. Để chặn nhiều bot, hãy liệt kê từng user-agent trong nhóm riêng của nó. Hãy nhớ rằng robots.txt chỉ mang tính khuyến nghị: các trình thu thập có hành vi tốt như GPTBot và ClaudeBot tôn trọng nó, nhưng nó không ngăn được một bot cố tình phớt lờ.
Nên chặn hay cho phép các bot AI?
Tùy vào mục tiêu của bạn. Hãy cho phép các bot tìm kiếm (OAI-SearchBot, Claude-SearchBot, PerplexityBot) để thương hiệu của bạn có thể được trích dẫn trong câu trả lời AI. Chỉ chặn các bot huấn luyện (GPTBot, CCBot, Google-Extended, Bytespider) khi bạn có lý do cụ thể để từ chối. Nghiên cứu của Rutgers/Wharton phát hiện những nhà xuất bản chặn trình thu thập AI trên diện rộng đã mất 23% tổng lưu lượng, nên việc cấm toàn bộ hiếm khi mang lại lợi ích.
ClaudeBot có tôn trọng robots.txt không?
Có. Tài liệu chính thức của Anthropic xác nhận rằng ClaudeBot, Claude-User và Claude-SearchBot đều tuân theo các chỉ thị robots.txt tiêu chuẩn, bao gồm cả phần mở rộng phi tiêu chuẩn Crawl-delay. Mỗi user-agent có thể được cho phép hoặc chặn độc lập, nên bạn có thể từ chối huấn luyện mà vẫn có thể được trích dẫn trong câu trả lời tìm kiếm của Claude.
Chặn Google-Extended có ảnh hưởng thứ hạng Google không?
Không. Google-Extended chỉ kiểm soát việc nội dung của bạn có được dùng để huấn luyện và làm nền tảng cho Gemini và Vertex AI hay không. Đây là một token tách biệt với Googlebot, nên chặn Google-Extended không ảnh hưởng gì đến thứ hạng của bạn trong Google Search. Đây là cách gọn gàng để từ chối huấn luyện AI mà không động đến tìm kiếm tự nhiên.
Việc chặn bot AI mặc định của Cloudflare có ghi đè quy tắc Allow trong robots.txt của tôi không?
Có, việc chặn ở cấp độ mạng sẽ thắng. Kể từ ngày 1 tháng 7 năm 2025, Cloudflare mặc định chặn bot AI trên mọi tên miền mới thông qua quy tắc được quản lý “AI Scrapers and Crawlers” của mình, ngay cả khi robots.txt của bạn ghi Allow. Nếu một bot hiển thị là Được phép trong công cụ kiểm tra này nhưng thực tế không thể lấy được các trang của bạn, hãy kiểm tra cài đặt Cloudflare Security → Bots.





