Đã thu thập dữ liệu - hiện chưa được lập chỉ mục: ý nghĩa và cách khắc phục

Đã thu thập dữ liệu - hiện chưa được lập chỉ mục: ý nghĩa và cách khắc phục

Google đã truy cập URL của bạn, đọc nội dung và để nó ngoài kết quả tìm kiếm. Dưới đây là cách nhận biết trang nào đáng được cho thêm cơ hội và cách Google hướng dẫn đưa chúng trở lại chỉ mục.

Đã thu thập dữ liệu - hiện chưa được lập chỉ mục có nghĩa là Googlebot đã tải trang của bạn và quyết định không thêm trang vào chỉ mục của Google, nên trang không thể xuất hiện trong kết quả tìm kiếm. Trợ giúp về báo cáo Lập chỉ mục trang của Google diễn đạt như sau: trang đã được thu thập dữ liệu nhưng chưa được lập chỉ mục, và trang “có thể được lập chỉ mục hoặc không trong tương lai”.

Nguyên nhân thường nằm ở chính trang, không phải do bị chặn về mặt kỹ thuật. Dưới đây, bạn sẽ thấy cách quyết định với từng URL nên sửa, noindex hay xóa, và Google cho biết một bản sửa lỗi mất bao lâu. Mới làm quen với báo cáo này? Hãy bắt đầu với hướng dẫn Google Search Console này.

“Đã thu thập dữ liệu - hiện chưa được lập chỉ mục” nghĩa là gì?

Trạng thái này có nghĩa là Google đã thu thập dữ liệu trang và chọn không lập chỉ mục trang đó. Không có gì chặn Googlebot: Google đã quyết định tạm thời để trang ở ngoài. Có hai điểm khác biệt giúp bạn hiểu đúng trạng thái này.

Thu thập dữ liệu và lập chỉ mục khác nhau thế nào

Thu thập dữ liệu là việc Googlebot tải một trang xuống. Lập chỉ mục là việc Google lưu trữ trang để nó có thể xuất hiện trong kết quả tìm kiếm. Một trang có thể được thu thập dữ liệu nhiều lần mà vẫn không bao giờ được lập chỉ mục.

Trợ giúp về Công cụ kiểm tra URL cho biết chất lượng của trang phải “đủ cao để được lập chỉ mục”, và tính năng kiểm tra trực tiếp hoàn toàn không thể kiểm tra trạng thái này.

Khác biệt so với “Đã phát hiện - hiện chưa được lập chỉ mục”

Đã phát hiện - hiện chưa được lập chỉ mục xảy ra sớm hơn một bước: Google đã tìm thấy URL nhưng hoãn việc thu thập dữ liệu để tránh làm quá tải trang web của bạn, nên ngày thu thập dữ liệu gần nhất để trống.

Đã phát hiện - hiện chưa được lập chỉ mụcĐã thu thập dữ liệu - hiện chưa được lập chỉ mục
Google đã thu thập dữ liệu?ChưaRồi
Lần thu thập dữ liệu gần nhấtĐể trốngCó ngày
Lý do thường gặpHoãn thu thập để tránh quá tải trang webGoogle đã đọc trang và bỏ qua
Xem trước tiênKhả năng thu thập dữ liệu, trên các trang web rất lớnChất lượng nội dung, trùng lặp, canonical

Google cũng nói rằng “Không được lập chỉ mục không nhất thiết là điều xấu.” Các trang bị noindex, URL bị chặn trong robots.txt, trang trùng lặp và các trang 404 không có trang thay thế vốn dĩ nên nằm ngoài chỉ mục.

Vì sao Google thu thập dữ liệu trang nhưng không lập chỉ mục

Lập chỉ mục có một ngưỡng chất lượng mà việc thu thập dữ liệu không có. Hướng dẫn về ngân sách thu thập dữ liệu của Google cho biết nhu cầu thu thập dữ liệu tăng theo giá trị và tính độc đáo của nội dung.

Hầu hết các URL bị ảnh hưởng thuộc một trong những nguyên nhân sau, mỗi nguyên nhân kèm điều cần kiểm tra đầu tiên:

  • Nội dung mỏng hoặc thiếu độc đáo: trang lặp lại những gì đã xếp hạng.
  • Trùng lặp: trang lưu trữ thẻ, URL sắp xếp, hai bài viết cùng một chủ đề. Đây là cách phát hiện và khắc phục tình trạng ăn thịt từ khóa.
  • Xung đột canonical: so sánh canonical bạn khai báo với URL chính tắc do Google chọn. Khi Google chọn một URL khác, trang thường chuyển sang Trang thay thế có thẻ chính tắc thích hợp hoặc một trạng thái trùng lặp.
  • Soft 404 và chuỗi chuyển hướng: Google cho biết soft 404 gây lãng phí ngân sách thu thập dữ liệu.
  • Ngân sách thu thập dữ liệu: chỉ quan trọng với các trang web có hơn 1.000.000 trang thay đổi hằng tuần hoặc hơn 10.000 trang thay đổi hằng ngày. Với hầu hết các trang web, đây không phải là nguyên nhân.
Các nguyên nhân gây ra trạng thái Đã thu thập dữ liệu - hiện chưa được lập chỉ mục và điều cần kiểm tra đầu tiên cho từng nguyên nhân: nội dung mỏng hoặc thiếu độc đáo, so sánh với những gì đã xếp hạng; trùng lặp, tìm trang mạnh hơn cùng chủ đề; xung đột canonical, so sánh canonical khai báo với canonical do Google chọn; soft 404 và chuỗi chuyển hướng, kiểm tra mã trạng thái và từng bước chuyển hướng; ngân sách thu thập dữ liệu, chỉ với trang web có hơn 1.000.000 trang hoặc hơn 10.000 trang thay đổi mỗi ngày
Từng nguyên nhân và điều cần kiểm tra đầu tiên

Ngưỡng này được nâng lên qua hai mốc có ngày cụ thể. Vào ngày 18 tháng 8 năm 2022, Google công bố bản cập nhật nội dung hữu ích, một tín hiệu trên toàn trang web, và cho biết việc xóa nội dung không hữu ích có thể giúp phần còn lại của trang web. Vào ngày 5 tháng 3 năm 2024, Google công bố một bản cập nhật cốt lõi nhằm hiển thị ít hơn những nội dung được tạo ra để thu hút lượt nhấp, cùng với chính sách spam mới về lạm dụng nội dung quy mô lớn.

Hướng dẫn về nội dung hữu ích của Google cho biết E-E-A-T không phải là một yếu tố xếp hạng cụ thể, rằng độ tin cậy là quan trọng nhất, và không có số lượng từ nào được ưu tiên. Độn chữ vào trang sẽ không giải quyết được vấn đề.

Cách tìm và chẩn đoán các trang bị ảnh hưởng trong GSC

Mở báo cáo Lập chỉ mục trang (trước đây là báo cáo Phạm vi lập chỉ mục), kiểm tra một mẫu, rồi nhóm danh sách theo mẫu hình. Google lưu ý rằng các trang web có dưới 500 trang có lẽ không cần đến báo cáo này.

Tìm các URL bị ảnh hưởng trong báo cáo Trang

  1. Trong Google Search Console, vào Lập chỉ mục › Trang.
  2. Trong mục “Lý do khiến trang không được lập chỉ mục”, nhấp vào Đã thu thập dữ liệu - hiện chưa được lập chỉ mục.
  3. Nhấp vào Xuất và tải danh sách xuống.

Báo cáo hiển thị tối đa 1.000 URL mẫu, không nhất thiết là tất cả, nên với một trang web lớn, tệp xuất chỉ là một mẫu.

Kiểm tra trang bằng Công cụ kiểm tra URL

Kiểm tra từ năm đến mười URL đã xuất để xem ngày thu thập dữ liệu gần nhất và URL chính tắc do Google chọn. Một URL chính tắc trỏ đến nơi khác nghĩa là Google coi trang là bản trùng lặp; ngày thu thập dữ liệu từ nhiều tháng trước cho thấy Google hiếm khi quay lại.

Phát hiện mẫu hình trong hàng trăm URL

Sắp xếp tệp xuất theo thư mục, template và tham số URL, rồi đếm từng nhóm. Giả sử 300 URL chia thành 180 trang /tag/, 70 URL ?sort= và 50 bài viết: đó là ba quyết định, không phải 300.

Sửa, noindex hay xóa: quyết định điều mỗi URL xứng đáng nhận

Mỗi URL xứng đáng nhận một trong bốn kết quả. Hãy tự hỏi: người tìm kiếm có vui khi đến trang này không, và đây có phải là trang duy nhất trên trang web của bạn trả lời truy vấn đó không?

Loại trangVí dụQuyết địnhCách làm
Hữu ích và độc đáo, nhưng mỏngMột hướng dẫn 300 từ về chủ đề bạn am hiểuCải thiệnThêm chiều sâu và chi tiết từ trải nghiệm thực tế
Trùng lặp với một trang mạnh hơnHai bài viết cho cùng một truy vấnHợp nhấtChuyển nội dung, rồi chuyển hướng 301
Hữu ích trên trang web, không cần trong tìm kiếmTrang lưu trữ thẻ, tìm kiếm nội bộ, trang cảm ơnNoindexThẻ meta robots hoặc X-Robots-Tag
Không có giá trị, không có trang thay thếKhuyến mãi đã hết hạn, trang thử nghiệmXóaTrả về 404 hoặc 410

Hướng dẫn về ngân sách thu thập dữ liệu của Google ủng hộ hai hàng cuối: trả về 404 hoặc 410 cho các trang đã xóa và hợp nhất các trang trùng lặp. Một lỗi 404 trong Search Console là điều bình thường với những trang bạn xóa có chủ đích.

Cây quyết định cho một trang đã được thu thập dữ liệu nhưng chưa được lập chỉ mục: nếu trang không có giá trị trên trang web hay trong tìm kiếm, hãy xóa và trả về 404 hoặc 410; nếu trang không nên xuất hiện trong kết quả tìm kiếm, hãy noindex và vẫn cho phép thu thập dữ liệu; nếu một trang mạnh hơn đã trả lời cùng truy vấn, hãy hợp nhất bằng một chuyển hướng 301; nếu không, hãy cải thiện bằng chiều sâu, dữ liệu riêng và chi tiết từ trải nghiệm thực tế
Cải thiện, hợp nhất, noindex hay xóa

Noindex là chỗ việc phân loại hay sai nhất:

Đừng làm thế này: gắn thẻ noindex cho các trang /tag/ trong khi robots.txt chặn /tag/. Googlebot không thể tải các trang này, nên sẽ không bao giờ thấy thẻ.

Hãy làm thế này: để /tag/ vẫn được thu thập dữ liệu và đặt noindex dưới dạng thẻ meta hoặc header X-Robots-Tag.

Theo tài liệu về noindex của Google, quy tắc này không hoạt động trong robots.txt, và với những trang hiếm khi được truy cập, việc thu thập lại dữ liệu có thể mất hàng tháng. Khi thẻ được đọc, các URL đó sẽ chuyển sang Bị loại trừ bởi thẻ 'noindex', đúng là điều bạn muốn với chúng.

Cách sửa những trang đáng được lập chỉ mục

Hãy làm cho trang xứng đáng được lập chỉ mục trước, rồi mới báo cho Google. Yêu cầu lập chỉ mục cho một trang không thay đổi là đề nghị Google lặp lại một quyết định mà họ đã đưa ra. Thứ tự như sau:

  1. Cải thiện nội dung.
  2. Hợp nhất trùng lặp và sửa canonical.
  3. Thêm liên kết nội bộ.
  4. Gửi một sơ đồ trang web tập trung và yêu cầu lập chỉ mục.
Thứ tự khắc phục cho các trang đáng được lập chỉ mục, gồm bốn bước: cải thiện nội dung bằng dữ liệu riêng và câu trả lời trực tiếp; hợp nhất trùng lặp bằng một chuyển hướng 301 duy nhất và canonical thống nhất; thêm liên kết nội bộ từ các trang đã được lập chỉ mục có lưu lượng truy cập; gửi sơ đồ trang web chỉ gồm các URL đã sửa, rồi yêu cầu lập chỉ mục và xác thực bản sửa lỗi
Sửa trang trước, rồi mới báo cho Google

Tăng chiều sâu và tính độc đáo của nội dung

Viết lại dựa trên truy vấn, không phải số lượng từ: thêm dữ liệu riêng, ảnh chụp màn hình, một ví dụ cụ thể và câu trả lời trực tiếp gần đầu trang.

Ví dụ, với một hướng dẫn mỏng 300 từ: hãy thêm một bộ dữ liệu tự thu thập và một ví dụ cụ thể, liên kết đến nó từ hai bài viết đã có lưu lượng truy cập, và chỉ sau đó mới thêm nó vào một sơ đồ trang web tập trung.

Hợp nhất trùng lặp và sửa canonical

Khi hai URL cùng nói về một nội dung, hãy giữ lại một URL, chuyển phần nội dung hữu ích sang đó và dùng chuyển hướng 301 để đưa URL còn lại thẳng đến đó, không qua chuỗi. Sau đó, kiểm tra để chắc chắn canonical, sơ đồ trang web và liên kết nội bộ thống nhất với nhau, và không còn thẻ noindex sót lại.

Thêm liên kết nội bộ từ những trang Google đã đánh giá cao

Liên kết đến từng trang đã sửa từ các trang đã được lập chỉ mục có lưu lượng truy cập, với anchor text mô tả rõ ràng. Bất kỳ công cụ thu thập dữ liệu trang web nào cũng có thể liệt kê trang mồ côi (không có liên kết nội bộ nào) bằng cách lọc các trang có 0 liên kết đến. Phương pháp đầy đủ có trong hướng dẫn chiến lược liên kết nội bộ này.

Hãy kiểm tra cả trang trên điện thoại và trong báo cáo Chỉ số thiết yếu về trang web: một trang bị lỗi trên di động rất dễ loại trừ.

Gửi một sơ đồ trang web tập trung và yêu cầu lập chỉ mục

Tạo một sơ đồ trang web chỉ gồm các URL bạn đã sửa, gửi nó đi và lọc báo cáo Trang theo sơ đồ đó trước khi nhấp vào Xác thực bản sửa lỗi. Google đề xuất cách này để đẩy nhanh quá trình xác thực. Nếu trước tiên bạn cần tệp hiện tại, hãy tìm sơ đồ trang web của trang web bạn.

Google bỏ qua priority và changefreq, vì vậy hãy giữ lastmod chính xác. Sau đó, nhấp vào Yêu cầu lập chỉ mục trong Công cụ kiểm tra URL cho các URL ưu tiên của bạn: Google áp dụng hạn mức và cho biết gửi yêu cầu lặp lại không giúp mọi thứ nhanh hơn.

Mất bao lâu để được lập chỉ mục sau khi sửa?

Hãy dự kiến từ một ngày đến vài tuần, và việc lập chỉ mục không bao giờ được đảm bảo. Google đưa ra các khoảng thời gian khác nhau ở những trang khác nhau, vì vậy dưới đây là bảng so sánh:

Việc bạn đã làmGoogle nói gìNguồn
Yêu cầu Google thu thập lại dữ liệuTừ vài ngày đến vài tuầnYêu cầu Google thu thập lại dữ liệu
Yêu cầu lập chỉ mụcThường khoảng một ngày, tối đa một đến hai tuần, có giới hạn hằng ngàyTrợ giúp Công cụ kiểm tra URL
Xác thực bản sửa lỗiTối đa khoảng hai tuần, đôi khi lâu hơn nhiềuTrợ giúp Lập chỉ mục trang

Đây là mốc thời gian của Google, không phải các trường hợp phục hồi thực tế. Hãy kiểm tra báo cáo Trang hằng tuần; nếu các URL đã sửa vẫn chưa thay đổi sau các khoảng thời gian đó, hãy quay lại với nội dung.

Cách ngăn các trang mới rơi vào trạng thái này

Phòng ngừa là một thói quen: kiểm tra từng trang trước khi xuất bản và xem lại Search Console hằng tháng. Trước khi xuất bản, hãy xác nhận rằng trang:

  • Trả lời một truy vấn mà không trang nào khác trên trang web của bạn trả lời.
  • Bổ sung dữ liệu, ví dụ hoặc trải nghiệm của riêng bạn.
  • Có canonical tự tham chiếu và không có noindex sót lại.
  • Có trong sơ đồ trang web với lastmod chính xác.
  • Có tên tác giả rõ ràng và, khi phù hợp, có dữ liệu có cấu trúc.
  • Nhận được liên kết từ một trang liên quan đã được lập chỉ mục.

Mỗi tháng một lần, hãy so sánh báo cáo Trang với tháng trước; một vấn đề vẫn được liệt kê trong 90 ngày sau khi trường hợp cuối cùng biến mất. Các trang web có hơn một nghìn trang cũng nên theo dõi báo cáo Thống kê thu thập dữ liệu.

SEOcrawl AI xử lý phần kỹ thuật ở quy mô lớn. Crawler quét mọi trang và trả về Audit Health Score, với các vấn đề được phân loại theo Indexability, Crawlability, On-Page và nhiều nhóm khác. Chế độ xem Indexation nhóm các URL theo trạng thái lập chỉ mục trong Search Console, để bạn biết có bao nhiêu URL đang ở trạng thái “Đã thu thập dữ liệu - hiện chưa được lập chỉ mục” và theo dõi con số đó theo thời gian.

Giữa các lần thu thập dữ liệu, SEO Monitor cảnh báo bạn khi một trang quan trọng bị gắn noindex, thay đổi canonical, trả về 404 hoặc rời khỏi sơ đồ trang web. Cùng nền tảng này còn theo dõi mức độ hiển thị thương hiệu của bạn trên ChatGPT, Claude, Gemini, Perplexity và Copilot, để SEO và GEO nằm chung một chỗ.

Câu hỏi thường gặp

“Đã thu thập dữ liệu - hiện chưa được lập chỉ mục” nghĩa là gì?

Trạng thái này có nghĩa là Googlebot đã tải trang của bạn và quyết định không thêm trang vào chỉ mục của Google, nên trang không thể xuất hiện trong kết quả tìm kiếm. Không có gì chặn việc thu thập dữ liệu: Google đã đọc trang và tạm thời chọn để nó ở ngoài. Đây không phải là hình phạt thủ công, và trang có thể được lập chỉ mục hoặc không trong tương lai.

Trạng thái này có giống “Đã phát hiện - hiện chưa được lập chỉ mục” không?

Không. “Đã phát hiện” nghĩa là Google biết URL nhưng đã hoãn việc thu thập dữ liệu, nên ngày thu thập dữ liệu gần nhất để trống. “Đã thu thập dữ liệu” nghĩa là Google đã truy cập và đọc trang, rồi quyết định không lập chỉ mục. Với “Đã phát hiện”, hãy xem khả năng thu thập dữ liệu trên các trang web rất lớn; với “Đã thu thập dữ liệu”, hãy xem chất lượng nội dung, trùng lặp và canonical.

“Đã thu thập dữ liệu - hiện chưa được lập chỉ mục” có làm hại SEO của tôi không?

Bản thân trạng thái này thì không: nó không phải là hình phạt, và trang bị ảnh hưởng chỉ mất lưu lượng tìm kiếm của chính nó. Rủi ro nằm ở số lượng, vì Google coi một tỷ lệ lớn nội dung không hữu ích là tín hiệu trên toàn trang web. Một trang lưu trữ thẻ nằm ngoài chỉ mục không gây thiệt hại gì; một trang sản phẩm thì có. Nếu con số tăng lên mỗi lần bạn đăng bài, hãy xử lý nó như một vấn đề nội dung ở cấp trang web, chứ không phải một danh sách URL riêng lẻ.

Mất bao lâu để một trang được lập chỉ mục sau khi sửa?

Hãy dự kiến từ một ngày đến vài tuần, và việc lập chỉ mục không bao giờ được đảm bảo. Google cho biết việc thu thập lại dữ liệu mất từ vài ngày đến vài tuần, một yêu cầu lập chỉ mục thường được xử lý trong khoảng một ngày nhưng có thể mất một đến hai tuần, và việc xác thực bản sửa lỗi thường mất tối đa khoảng hai tuần.

Yêu cầu lập chỉ mục có giúp ích không?

Chỉ sau khi bạn đã thay đổi trang. Yêu cầu lập chỉ mục cho một trang không thay đổi là đề nghị Google lặp lại một quyết định mà họ đã đưa ra. Các yêu cầu bị giới hạn bởi hạn mức hằng ngày, và Google cho biết gửi cùng một URL nhiều lần không giúp mọi thứ nhanh hơn.

Thêm trang vào sơ đồ trang web XML có giúp ích không?

Nó giúp Google tìm thấy URL, chứ không giúp lập chỉ mục URL. Google gọi sơ đồ trang web đã gửi là “chỉ là một gợi ý”, và các trang này đã được tìm thấy và đọc rồi. Sau khi sửa, nhiệm vụ của sơ đồ trang web là gom các URL bạn muốn Google kiểm tra lại. Mỗi tệp sơ đồ trang web chứa tối đa 50.000 URL hoặc 50 MB.

Vì sao quá trình xác thực “Đã thu thập dữ liệu - hiện chưa được lập chỉ mục” của tôi thất bại?

Quá trình xác thực dừng lại ngay khi Google tìm thấy một URL trong nhóm vẫn chưa được sửa, nên chỉ một trang còn sót cũng có thể khiến cả lô thất bại. Hãy sửa mọi URL trong nhóm, hoặc thu hẹp nhóm bằng cách lọc báo cáo theo một sơ đồ trang web chỉ gồm các URL đã sửa, rồi xác thực lại.

SEOcrawl AI có thể giúp gì với những trang Google thu thập dữ liệu nhưng không lập chỉ mục?

SEOcrawl AI tìm ra các nguyên nhân nằm trên trang web đứng sau trạng thái này. Crawler hiển thị điểm sức khỏe, mã trạng thái HTTP và độ sâu thu thập dữ liệu của từng URL, để bạn phát hiện những trang Google khó tiếp cận. Chế độ xem Indexation nhóm các URL theo trạng thái lập chỉ mục trong Search Console, và SEO Monitor cảnh báo bạn khi một trang quan trọng bị gắn noindex, thay đổi canonical, trả về 404 hoặc rời khỏi sơ đồ trang web.

Tác giả: David Kaufmann

David Kaufmann

Tôi đã dành hơn 10 năm qua hoàn toàn đắm chìm trong SEO — và thành thật mà nói, tôi không muốn điều gì khác thay thế.

Sự nghiệp của tôi bước sang một tầm cao mới khi tôi làm việc với vai trò chuyên gia SEO cấp cao tại Chess.com — một trong 100 website được truy cập nhiều nhất trên toàn bộ internet. Vận hành ở quy mô đó, trên hàng triệu trang, hàng chục ngôn ngữ và trong một trong những SERPs cạnh tranh khốc liệt nhất, đã dạy tôi những điều mà không khóa học hay chứng chỉ nào có thể mang lại. Trải nghiệm đó đã thay đổi cách tôi nhìn nhận về SEO thực sự xuất sắc — và trở thành nền tảng cho mọi thứ tôi xây dựng từ đó đến nay.

Từ kinh nghiệm ấy, tôi đã sáng lập SEO Alive — một agency dành cho những thương hiệu thực sự nghiêm túc với tăng trưởng organic. Chúng tôi không ở đây để bán dashboards và báo cáo hàng tháng. Chúng tôi ở đây để xây dựng những chiến lược thực sự tạo ra chuyển biến, kết hợp tinh hoa của SEO truyền thống với thế giới mới đầy thú vị của Generative Engine Optimization (GEO) — đảm bảo thương hiệu của bạn không chỉ xuất hiện trong các liên kết xanh của Google, mà còn hiện diện ngay trong những câu trả lời do AI tạo ra mà ChatGPT, Perplexity và Google AI Overviews đang cung cấp cho hàng triệu người mỗi ngày.

Và bởi vì tôi không thể tìm được một công cụ xử lý tốt cả hai thế giới đó, tôi đã tự xây dựng một công cụ — SEOcrawl AI, một nền tảng SEO intelligence cấp doanh nghiệp tích hợp rankings, kiểm tra kỹ thuật, giám sát backlinks, tình trạng crawl và theo dõi hiển thị thương hiệu trên AI, tất cả trong một nơi. Đó chính là nền tảng mà tôi luôn ước có.

→ Đọc tất cả bài viết của David
Thêm bài viết của David Kaufmann

Khám phá thêm nội dung của tác giả này