Crawl Stats Google Search Console: Cách xem, đọc chỉ số và phát hiện lỗi crawl
Crawl Stats trong Google Search Console là gì?
Crawl Stats là báo cáo trong Google Search Console ghi nhận lịch sử thu thập dữ liệu của Google trên website. Báo cáo cung cấp số yêu cầu, dung lượng tải, thời gian phản hồi và trạng thái kết nối, giúp đánh giá khả năng Google truy cập tài nguyên.
Đây không phải dữ liệu thời gian thực hay công cụ xác nhận trạng thái lập chỉ mục từng URL. Cần phân biệt:
- Crawl: Yêu cầu và tải dữ liệu từ website.
- Render: Xử lý tài nguyên để hiểu nội dung hiển thị.
- Index: Phân tích và lưu thông tin vào chỉ mục.
- Ranking: Sắp xếp kết quả phù hợp với truy vấn.
Website nào nên theo dõi thường xuyên?
Bạn nên ưu tiên website nhiều URL, cập nhật thường xuyên hoặc vừa đổi nền tảng. Ví dụ như danh mục thiết bị công nghiệp có bộ lọc thông số dễ phát sinh URL tham số. Còn đối với website nhỏ, ổn định có thể kiểm tra định kỳ và sau thay đổi lớn, thay vì theo dõi hằng ngày.
Crawl Stats có ảnh hưởng trực tiếp đến thứ hạng không?
Không. Báo cáo phản ánh hoạt động truy cập, không phải tín hiệu xếp hạng. Tuy nhiên, lỗi truy cập kéo dài có thể cản trở cập nhật nội dung. Để kiểm tra URL, bạn dùng Page indexing (Lập chỉ mục trang) và URL Inspection (Kiểm tra URL).

Cách xem Crawl Stats trong Google Search Console
Đường dẫn truy cập là Settings → Crawl stats → Open report:
- Đăng nhập Google Search Console.
- Chọn property, tức phạm vi website cần xem.
- Mở Settings (Cài đặt).
- Tìm nhóm Crawling (Thu thập dữ liệu).
- Chọn Open report (Mở báo cáo) tại Crawl stats.
Báo cáo hỗ trợ Domain property (thuộc tính miền) hoặc URL-prefix property (thuộc tính tiền tố URL) ở cấp gốc. Cấp gốc bao phủ toàn bộ host, không chỉ một thư mục con như /san-pham/.
Các lý do phổ biến khiến báo cáo Crawl Stats không hiển thị:
Tình huống | Cách kiểm tra |
|---|---|
Property không phù hợp | Chuyển từ phạm vi thư mục sang thuộc tính cấp gốc. |
Nhầm hostname hoặc giao thức | Kiểm tra đúng phiên bản website; dữ liệu có thể khác, không nhất thiết mất menu. |
Quyền tài khoản bị hạn chế | Nhờ quản trị viên kiểm tra quyền truy cập. |
Giao diện khác ngôn ngữ | Tìm trong Cài đặt, nhóm thu thập dữ liệu. |
Có báo cáo nhưng ít dữ liệu | Kiểm tra kỳ báo cáo, độ trễ và thời gian thuộc tính được thiết lập. |
Nếu bạn không thấy dữ liệu, nguyên nhân thường do báo cáo chưa đủ thông tin hoặc thiết lập chưa chính xác.

Cách đọc ba chỉ số tổng quan trong Crawl Stats
Hãy so sánh với giai đoạn ổn định của chính website, thay vì áp một ngưỡng tốt/xấu chung.
Chỉ số | Phản ánh điều gì? | Khi nào cần kiểm tra? |
|---|---|---|
Total crawl requests | Tổng yêu cầu thu thập, kể cả thất bại | Tăng hoặc giảm mạnh, thiếu bối cảnh giải thích |
Total download size | Tổng dung lượng Google tải trong kỳ | Tăng không tương ứng với số yêu cầu |
Average response time | Thời gian phản hồi trung bình | Tăng kéo dài, nhất là khi xuất hiện lỗi |
Total crawl requests là gì?
Đây là số lượng tổng các yêu cầu gửi đến máy chủ của bạn, không phải số lượng URL duy nhất. Mỗi trang có thể được gọi nhiều lần, tính cả hình ảnh hay các tệp tài nguyên đi kèm.
Số liệu này có thể tăng hợp lý khi bạn thêm danh mục mới, hoặc tăng đột biến do các URL bộ lọc phát sinh. Ngược lại, nếu lượng truy cập thu thập giảm, điều đó chưa đủ để kết luận website đang gặp lỗi.
Total download size là gì?
Chỉ số này thể hiện tổng dữ liệu được tải, không tính phần tiêu đề phản hồi HTTP. Tài nguyên có thể gồm HTML, ảnh, CSS, JavaScript và PDF.
Ví dụ, tài liệu PDF kỹ thuật lớn hơn có thể làm dung lượng tăng dù requests ít biến động. Không đồng nhất chỉ số này với toàn bộ băng thông hosting.
Average response time là gì?
Chỉ số được tính bằng mili giây, phản ánh thời gian đáp ứng các yêu cầu thu thập tài nguyên. Nó không phải thời gian tải trang của người dùng hoặc Core Web Vitals (nhóm chỉ số trải nghiệm trang). Nếu thời gian tăng kéo dài, đồng thời xuất hiện 5xx hoặc requests giảm, cần kiểm tra hạ tầng.
Đọc ba chỉ số cùng nhau. Báo cáo có độ trễ và không thay thế giám sát uptime - khả năng website hoạt động tại thời điểm hiện tại.

Cách đọc Host Status và các nhóm dữ liệu chi tiết
Kiểm tra khả năng Google kết nối trước khi phân tích Google đang thu thập nội dung gì.
Host Status: Website có phục vụ Googlebot ổn định không?
Host Status (Trạng thái máy chủ) tổng hợp những vấn đề truy cập quan trọng.
Hạng mục | Nội dung kiểm tra | Người phối hợp |
|---|---|---|
robots.txt fetch | Khả năng lấy tệp quy tắc thu thập | SEO và Developer |
DNS resolution | Khả năng phân giải tên miền | Đơn vị DNS/hosting |
Server connectivity | Khả năng kết nối máy chủ | Developer và hosting |
Đọc kỹ nhãn trạng thái và khoảng thời gian thay vì chỉ nhìn màu sắc; các cảnh báo lịch sử không đồng nghĩa với lỗi hiện tại. Trong khi robots.txt trả về mã 404 không có nghĩa là website đang bị chặn crawl, thì lỗi mạng hoặc mã 5xx khi tải tệp có thể khiến Google tạm dừng thu thập dữ liệu tùy thuộc vào thời điểm xảy ra và phiên bản lưu trữ trước đó.

Crawl responses và mã trạng thái HTTP
Crawl responses (Phản hồi thu thập) cho biết kết quả các yêu cầu. Mã HTTP là mã phản hồi từ máy chủ.
Nhóm mã | Cách hiểu và kiểm tra |
|---|---|
200 | Thành công; không bảo đảm lập chỉ mục. |
Chuyển hướng; kiểm tra đích và chuỗi khi bất thường. | |
Tài nguyên không thay đổi; có thể hợp lệ. | |
404/410 | Có thể đúng với nội dung đã xóa; ưu tiên URL quan trọng lỗi ngoài chủ đích. |
401/403 | Hạn chế truy cập; rà soát nếu nội dung cần công khai. |
Giới hạn yêu cầu; kiểm tra khi kéo dài hoặc diện rộng. | |
Lỗi máy chủ; ưu tiên theo phạm vi và thời gian kéo dài. |
Lỗi DNS, lỗi lấy dữ liệu và lỗi chuyển hướng không phải các mã HTTP.
Crawl requests theo loại tệp
Các nhóm phổ biến gồm HTML, ảnh, JavaScript, CSS và PDF. Không có tỷ lệ chuẩn cho mọi website. Không chặn CSS hoặc JavaScript phục vụ render chỉ vì requests cao.
Crawl purpose: Discovery và Refresh
- Discovery: Thu thập URL lần đầu.
- Refresh: Thu thập lại URL đã biết.
Việc chỉ số Discovery tăng sau khi chuyển đổi nền tảng website là hiện tượng hoàn toàn bình thường và có thể hợp lý. Bạn chỉ nên nghi ngờ về các URL dư thừa khi phát hiện các mẫu URL (URL patterns) hoặc cấu trúc website bất thường.
Cần lưu ý rằng chỉ số này phản ánh số lượng URL mới được Googlebot phát hiện, chứ không đồng nghĩa với tổng số trang đã được lập chỉ mục thành công (index).
Quy trình 5 bước phát hiện vấn đề bằng Crawl Stats
Quy trình đề xuất dưới đây giúp xác minh tín hiệu trước khi quyết định tối ưu crawl:
- Kiểm tra Host Status: Đọc cảnh báo và xác định thời gian xảy ra.
- Đọc ba chỉ số tổng quan: So sánh với lịch sử và lịch thay đổi website.
- Kiểm tra phản hồi: Khoanh vùng mã lỗi và vấn đề kết nối.
- Xem nhóm yêu cầu: Đối chiếu loại tệp, mục đích và loại Googlebot.
- Kiểm tra URL mẫu: So sánh với công cụ kiểm tra URL và dữ liệu kỹ thuật.
URL hiển thị chỉ là mẫu, không phải toàn bộ yêu cầu. Khi cần xác minh chi tiết, dùng server logs (nhật ký truy cập máy chủ).
Bảng tín hiệu – nguyên nhân – hành động – người xử lý
Tín hiệu | Nguyên nhân giả thuyết | Kiểm tra và hành động có điều kiện | Phụ trách |
|---|---|---|---|
Host cảnh báo nghiêm trọng | Có thể lỗi DNS/tường lửa | Xác minh truy cập hiện tại, lớp phân phối nội dung CDN và logs | Hosting/Dev |
Response time tăng kéo dài | Có thể tăng tải, lỗi cache | Đối chiếu tải, bộ nhớ đệm và lịch triển khai | Dev |
5xx tăng | Có thể lỗi ứng dụng | Khoanh thời gian, nhóm URL; sửa khi xác nhận lỗi | Dev |
404 tăng | Có thể xóa hoặc mất trang | Phân loại URL; khôi phục trang quan trọng nếu mất ngoài ý muốn | SEO/Dev |
Redirect tăng | Có thể do đổi nền tảng | Kiểm tra chuỗi, đích; cập nhật liên kết phù hợp | SEO/Dev |
Requests giảm | Có thể ít cập nhật hoặc lỗi truy cập | Kiểm tra lịch xuất bản và cấu hình; không kết luận bị phạt | SEO/Dev |
Discovery tăng | Có thể phát sinh tham số | Mở URL mẫu, xác định nguồn sinh URL | SEO/Dev |
Crawl tăng, index không tăng | Có thể trùng lặp hoặc nhiều nguyên nhân khác | Đối chiếu Page indexing, URL Inspection trước khi sửa | SEO |
Khi crawl tăng hoặc giảm, lúc nào cần hành động?
- Theo dõi: Biến động có bối cảnh hợp lý, không kèm lỗi.
- Kiểm tra thêm: Xu hướng kéo dài, chưa giải thích được hoặc phản hồi chậm hơn.
- Ưu tiên xác minh và xử lý: Lỗi kết nối/5xx diện rộng còn tiếp diễn, hoặc lỗi hạ tầng ngăn lấy
robots.txt.
Không chuyển hướng mọi 404 về trang chủ. Không sửa robots.txt, canonical (tín hiệu URL đại diện) hoặc chuyển hướng chỉ vì một biến động ngắn hạn. Hai sự kiện xảy ra gần nhau chưa chứng minh quan hệ nhân quả.

Những hiểu lầm phổ biến khi đọc Crawl Stats và crawl budget
Crawl budget liên quan cả khả năng và nhu cầu thu thập của Google, không phải hạn mức cố định website được cấp.
- “Crawl nhiều thì thứ hạng cao”: Lượt yêu cầu thu thập dữ liệu (crawl requests) phản ánh mức độ hoạt động của Googlebot trên máy chủ, không phải là yếu tố đo lường hay trực tiếp quyết định thứ hạng từ khóa.
- “Crawl thành công là được index”: Phản hồi thành công chỉ xác nhận khả năng tải; Google còn đánh giá nội dung và các tín hiệu khác.
- “Crawl giảm luôn là xấu”: Hoạt động thu thập có thể giảm một cách tự nhiên và hợp lý nếu trang web ít thay đổi hoặc đã được tối ưu loại bỏ các URL trùng lặp, dư thừa.
- “noindex ngăn crawl”: Thẻ
noindexlà chỉ thị không lập chỉ mục; Google cần truy cập trang để đọc được chỉ thị đó. - “robots.txt xóa URL khỏi chỉ mục”: Tệp kiểm soát truy cập thu thập; URL bị chặn vẫn có thể được biết đến qua nguồn khác.
- “Website nào cũng phải ưu tiên crawl budget”: Website nhỏ, ổn định thường nên tập trung khả năng truy cập, cấu trúc và nội dung trước.
- “Requests CSS/JavaScript cao thì nên chặn”: Chặn tài nguyên thiết yếu có thể khiến Google không hiểu đầy đủ nội dung hiển thị.
- “Có benchmark chung cho mọi website”: Thời gian phản hồi, tỷ lệ tệp và requests phải được đọc theo lịch sử, quy mô và cấu trúc.

Checklist kiểm tra Crawl Stats trong 10 phút
10 phút chỉ dành cho rà soát ban đầu, không bảo đảm chẩn đoán hoặc khắc phục mọi lỗi.
- Property và khoảng thời gian có đúng không?
- Host Status ghi trạng thái, lỗi nào?
- Kết nối hiện tại có bất thường không?
- Ba chỉ số thay đổi cùng nhau thế nào?
- Có 5xx, 429 hoặc lỗi chuyển hướng tăng không?
- URL quan trọng có trả 404 ngoài chủ đích không?
- Discovery tăng có kèm URL tham số không?
- Sitemap và internal link có trỏ URL không cần thiết không?
- Có thay đổi hosting, CDN hoặc CMS không?
- Đã đối chiếu Page indexing, URL Inspection hoặc logs khi cần chưa?
Ghi đầu ra thành ba mục: Vấn đề nghi ngờ, bằng chứng cần bổ sung, người phụ trách.
Tình huống minh họa: Website thiết bị công nghiệp bổ sung bộ lọc công suất; requests và Discovery cùng tăng. Giả thuyết là bộ lọc sinh thêm URL.
SEO cần kiểm tra URL mẫu, liên kết nội bộ, sitemap, canonical và Page indexing. Nếu xác nhận nhiều biến thể không cần thiết, phối hợp Developer hạn chế nguồn sinh và chuẩn hóa liên kết. Mục tiêu là ưu tiên URL có giá trị, không giảm crawl bằng mọi giá.

Câu hỏi thường gặp
Báo cáo Crawl Stats trong Google Search Console là gì?
Crawl Stats là báo cáo thống kê lịch sử hoạt động của Googlebot trên website của bạn trong 90 ngày gần nhất. Công cụ này giúp bạn theo dõi khả năng truy cập của Google, phát hiện các lỗi kết nối máy chủ và hiểu cách Google phân bổ lượt thu thập dữ liệu trên trang web.
Website nào nên thường xuyên theo dõi báo cáo Crawl Stats?
Báo cáo này đặc biệt quan trọng với các website thương mại điện tử lớn, trang tin tức có tần suất cập nhật cao hoặc các website B2B sở hữu danh mục sản phẩm phức tạp với nhiều bộ lọc. Các trang web ổn định có quy mô nhỏ có thể kiểm tra định kỳ hoặc sau khi thay đổi hạ tầng lớn.
Có nên chặn Googlebot thu thập dữ liệu bằng robots.txt để tiết kiệm ngân sách?
Không nên lạm dụng cách này. Bạn chỉ nên dùng tệp robots.txt để chặn Google truy cập các trang không có giá trị (như trang quản trị hoặc trang tìm kiếm nội bộ). Việc chặn bừa bãi các trang quan trọng có thể làm Google ngừng thu thập dữ liệu toàn bộ website và gây ảnh hưởng nghiêm trọng đến quá trình lập chỉ mục.
Mã phản hồi 404 trong báo cáo Crawl Stats có phải luôn là lỗi nghiêm trọng?
Không hẳn. Nếu các URL bị lỗi 404 là nội dung đã cũ, không còn tồn tại hoặc đã bị xóa chủ đích, đây là phản hồi hoàn toàn bình thường. Tuy nhiên, nếu đó là các trang quan trọng hoặc trang dẫn đến doanh thu, bạn cần kiểm tra lại liên kết nội bộ và thiết lập chuyển hướng phù hợp.
Average response time trong báo cáo có phải là tốc độ tải trang của người dùng?
Không. Đây là thời gian phản hồi của máy chủ dành riêng cho yêu cầu từ Googlebot, không phải là chỉ số trải nghiệm người dùng như Core Web Vitals. Mặc dù vậy, thời gian phản hồi quá cao (>2.000ms) kéo dài có thể khiến Googlebot giảm tần suất thu thập dữ liệu trên website của bạn.
Làm thế nào để xử lý khi thấy cảnh báo về Host Status?
Khi Host Status hiển thị cảnh báo, bạn cần kiểm tra ba yếu tố: khả năng truy cập tệp robots.txt, lỗi phân giải DNS và kết nối máy chủ. Hãy phối hợp với đội ngũ kỹ thuật hoặc đơn vị quản lý hosting để rà soát các thay đổi gần đây về cấu hình tường lửa, dịch vụ CDN hoặc lịch deploy website.
Xem thêm:
- Các lỗi crawl và index thường gặp: Cách kiểm tra và khắc phục
- Indexed Though Blocked by Robots.txt: Nguyên nhân và cách xử lý
- Web Crawler là gì? Cách bot thu thập dữ liệu website cho SEO
Kết luận
Đọc Crawl Stats trong Google Search Console nên bắt đầu từ Host Status, sau đó đến ba chỉ số tổng quan, phản hồi và URL mẫu. Trình tự này giúp nhận diện bất thường mà không nhầm số lượt Googlebot truy cập với số trang được lập chỉ mục.
Trước khi thay đổi cấu hình, hãy đối chiếu lịch triển khai, tình trạng truy cập hiện tại và dữ liệu URL cụ thể. Một biểu đồ riêng lẻ chưa đủ xác định nguyên nhân. Sử dụng checklist Crawl Stats ngay trong bài để ghi bằng chứng và phân công bước kiểm tra tiếp theo.

.jpg&w=160&q=75)


