Crawl Stats Google Search Console: Cách xem và đọc chỉ số

Báo cáo Crawl Stats trong Google Search Console giúp bạn theo dõi cách Googlebot truy cập website và phát hiện nhanh các lỗi kết nối ngay cả khi người dùng vẫn truy cập bình thường. Công cụ này chủ yếu dùng để chẩn đoán kỹ thuật, không yêu cầu chuyên môn sâu hay giải thích trực tiếp về thứ hạng SEO.

Ngày đăng: 09.10.2026, lúc 08:223 lượt xemLuân Vũ
Crawl Stats Google Search Console: Cách xem và đọc chỉ số

Crawl Stats Google Search Console: Cách xem, đọc chỉ số và phát hiện lỗi crawl

Crawl Stats trong Google Search Console là gì?

Crawl Stats là báo cáo trong Google Search Console ghi nhận lịch sử thu thập dữ liệu của Google trên website. Báo cáo cung cấp số yêu cầu, dung lượng tải, thời gian phản hồi và trạng thái kết nối, giúp đánh giá khả năng Google truy cập tài nguyên.

Đây không phải dữ liệu thời gian thực hay công cụ xác nhận trạng thái lập chỉ mục từng URL. Cần phân biệt:

  • Crawl: Yêu cầu và tải dữ liệu từ website.
  • Render: Xử lý tài nguyên để hiểu nội dung hiển thị.
  • Index: Phân tích và lưu thông tin vào chỉ mục.
  • Ranking: Sắp xếp kết quả phù hợp với truy vấn.

Website nào nên theo dõi thường xuyên?

Bạn nên ưu tiên website nhiều URL, cập nhật thường xuyên hoặc vừa đổi nền tảng. Ví dụ như danh mục thiết bị công nghiệp có bộ lọc thông số dễ phát sinh URL tham số. Còn đối với website nhỏ, ổn định có thể kiểm tra định kỳ và sau thay đổi lớn, thay vì theo dõi hằng ngày.

Crawl Stats có ảnh hưởng trực tiếp đến thứ hạng không?

Không. Báo cáo phản ánh hoạt động truy cập, không phải tín hiệu xếp hạng. Tuy nhiên, lỗi truy cập kéo dài có thể cản trở cập nhật nội dung. Để kiểm tra URL, bạn dùng Page indexing (Lập chỉ mục trang) và URL Inspection (Kiểm tra URL).

Sơ đồ phân biệt crawl, render, index và ranking

Cách xem Crawl Stats trong Google Search Console

Đường dẫn truy cập là Settings → Crawl stats → Open report:

  1. Đăng nhập Google Search Console.
  2. Chọn property, tức phạm vi website cần xem.
  3. Mở Settings (Cài đặt).
  4. Tìm nhóm Crawling (Thu thập dữ liệu).
  5. Chọn Open report (Mở báo cáo) tại Crawl stats.

Báo cáo hỗ trợ Domain property (thuộc tính miền) hoặc URL-prefix property (thuộc tính tiền tố URL) ở cấp gốc. Cấp gốc bao phủ toàn bộ host, không chỉ một thư mục con như /san-pham/.

Các lý do phổ biến khiến báo cáo Crawl Stats không hiển thị:

Tình huống

Cách kiểm tra

Property không phù hợp

Chuyển từ phạm vi thư mục sang thuộc tính cấp gốc.

Nhầm hostname hoặc giao thức

Kiểm tra đúng phiên bản website; dữ liệu có thể khác, không nhất thiết mất menu.

Quyền tài khoản bị hạn chế

Nhờ quản trị viên kiểm tra quyền truy cập.

Giao diện khác ngôn ngữ

Tìm trong Cài đặt, nhóm thu thập dữ liệu.

Có báo cáo nhưng ít dữ liệu

Kiểm tra kỳ báo cáo, độ trễ và thời gian thuộc tính được thiết lập.

Nếu bạn không thấy dữ liệu, nguyên nhân thường do báo cáo chưa đủ thông tin hoặc thiết lập chưa chính xác.
Cách xem Crawl Stats trong Google Search Console

Cách đọc ba chỉ số tổng quan trong Crawl Stats

Hãy so sánh với giai đoạn ổn định của chính website, thay vì áp một ngưỡng tốt/xấu chung.

Chỉ số

Phản ánh điều gì?

Khi nào cần kiểm tra?

Total crawl requests

Tổng yêu cầu thu thập, kể cả thất bại

Tăng hoặc giảm mạnh, thiếu bối cảnh giải thích

Total download size

Tổng dung lượng Google tải trong kỳ

Tăng không tương ứng với số yêu cầu

Average response time

Thời gian phản hồi trung bình

Tăng kéo dài, nhất là khi xuất hiện lỗi

Total crawl requests là gì?

Đây là số lượng tổng các yêu cầu gửi đến máy chủ của bạn, không phải số lượng URL duy nhất. Mỗi trang có thể được gọi nhiều lần, tính cả hình ảnh hay các tệp tài nguyên đi kèm.

Số liệu này có thể tăng hợp lý khi bạn thêm danh mục mới, hoặc tăng đột biến do các URL bộ lọc phát sinh. Ngược lại, nếu lượng truy cập thu thập giảm, điều đó chưa đủ để kết luận website đang gặp lỗi.

Total download size là gì?

Chỉ số này thể hiện tổng dữ liệu được tải, không tính phần tiêu đề phản hồi HTTP. Tài nguyên có thể gồm HTML, ảnh, CSS, JavaScript và PDF.

Ví dụ, tài liệu PDF kỹ thuật lớn hơn có thể làm dung lượng tăng dù requests ít biến động. Không đồng nhất chỉ số này với toàn bộ băng thông hosting.

Average response time là gì?

Chỉ số được tính bằng mili giây, phản ánh thời gian đáp ứng các yêu cầu thu thập tài nguyên. Nó không phải thời gian tải trang của người dùng hoặc Core Web Vitals (nhóm chỉ số trải nghiệm trang). Nếu thời gian tăng kéo dài, đồng thời xuất hiện 5xx hoặc requests giảm, cần kiểm tra hạ tầng.

Đọc ba chỉ số cùng nhau. Báo cáo có độ trễ và không thay thế giám sát uptime - khả năng website hoạt động tại thời điểm hiện tại.
Tổng quan ba chỉ số từ báo cáo

Cách đọc Host Status và các nhóm dữ liệu chi tiết

Kiểm tra khả năng Google kết nối trước khi phân tích Google đang thu thập nội dung gì.

Host Status: Website có phục vụ Googlebot ổn định không?

Host Status (Trạng thái máy chủ) tổng hợp những vấn đề truy cập quan trọng.

Hạng mục

Nội dung kiểm tra

Người phối hợp

robots.txt fetch

Khả năng lấy tệp quy tắc thu thập

SEO và Developer

DNS resolution

Khả năng phân giải tên miền

Đơn vị DNS/hosting

Server connectivity

Khả năng kết nối máy chủ

Developer và hosting

Đọc kỹ nhãn trạng thái và khoảng thời gian thay vì chỉ nhìn màu sắc; các cảnh báo lịch sử không đồng nghĩa với lỗi hiện tại. Trong khi robots.txt trả về mã 404 không có nghĩa là website đang bị chặn crawl, thì lỗi mạng hoặc mã 5xx khi tải tệp có thể khiến Google tạm dừng thu thập dữ liệu tùy thuộc vào thời điểm xảy ra và phiên bản lưu trữ trước đó.

Host Status (Trạng thái máy chủ) tổng hợp những vấn đề truy cập quan trọng

Crawl responses và mã trạng thái HTTP

Crawl responses (Phản hồi thu thập) cho biết kết quả các yêu cầu. Mã HTTP là mã phản hồi từ máy chủ.

Nhóm mã

Cách hiểu và kiểm tra

200

Thành công; không bảo đảm lập chỉ mục.

301/302/307/308

Chuyển hướng; kiểm tra đích và chuỗi khi bất thường.

304

Tài nguyên không thay đổi; có thể hợp lệ.

404/410

Có thể đúng với nội dung đã xóa; ưu tiên URL quan trọng lỗi ngoài chủ đích.

401/403

Hạn chế truy cập; rà soát nếu nội dung cần công khai.

429

Giới hạn yêu cầu; kiểm tra khi kéo dài hoặc diện rộng.

5xx

Lỗi máy chủ; ưu tiên theo phạm vi và thời gian kéo dài.

Lỗi DNS, lỗi lấy dữ liệu và lỗi chuyển hướng không phải các mã HTTP.

Crawl requests theo loại tệp

Các nhóm phổ biến gồm HTML, ảnh, JavaScript, CSS và PDF. Không có tỷ lệ chuẩn cho mọi website. Không chặn CSS hoặc JavaScript phục vụ render chỉ vì requests cao.

Crawl purpose: Discovery và Refresh

  • Discovery: Thu thập URL lần đầu.
  • Refresh: Thu thập lại URL đã biết.

Việc chỉ số Discovery tăng sau khi chuyển đổi nền tảng website là hiện tượng hoàn toàn bình thường và có thể hợp lý. Bạn chỉ nên nghi ngờ về các URL dư thừa khi phát hiện các mẫu URL (URL patterns) hoặc cấu trúc website bất thường.

Cần lưu ý rằng chỉ số này phản ánh số lượng URL mới được Googlebot phát hiện, chứ không đồng nghĩa với tổng số trang đã được lập chỉ mục thành công (index).

Quy trình 5 bước phát hiện vấn đề bằng Crawl Stats

Quy trình đề xuất dưới đây giúp xác minh tín hiệu trước khi quyết định tối ưu crawl:

  1. Kiểm tra Host Status: Đọc cảnh báo và xác định thời gian xảy ra.
  2. Đọc ba chỉ số tổng quan: So sánh với lịch sử và lịch thay đổi website.
  3. Kiểm tra phản hồi: Khoanh vùng mã lỗi và vấn đề kết nối.
  4. Xem nhóm yêu cầu: Đối chiếu loại tệp, mục đích và loại Googlebot.
  5. Kiểm tra URL mẫu: So sánh với công cụ kiểm tra URL và dữ liệu kỹ thuật.

URL hiển thị chỉ là mẫu, không phải toàn bộ yêu cầu. Khi cần xác minh chi tiết, dùng server logs (nhật ký truy cập máy chủ).

Bảng tín hiệu – nguyên nhân – hành động – người xử lý

Tín hiệu

Nguyên nhân giả thuyết

Kiểm tra và hành động có điều kiện

Phụ trách

Host cảnh báo nghiêm trọng

Có thể lỗi DNS/tường lửa

Xác minh truy cập hiện tại, lớp phân phối nội dung CDN và logs

Hosting/Dev

Response time tăng kéo dài

Có thể tăng tải, lỗi cache

Đối chiếu tải, bộ nhớ đệm và lịch triển khai

Dev

5xx tăng

Có thể lỗi ứng dụng

Khoanh thời gian, nhóm URL; sửa khi xác nhận lỗi

Dev

404 tăng

Có thể xóa hoặc mất trang

Phân loại URL; khôi phục trang quan trọng nếu mất ngoài ý muốn

SEO/Dev

Redirect tăng

Có thể do đổi nền tảng

Kiểm tra chuỗi, đích; cập nhật liên kết phù hợp

SEO/Dev

Requests giảm

Có thể ít cập nhật hoặc lỗi truy cập

Kiểm tra lịch xuất bản và cấu hình; không kết luận bị phạt

SEO/Dev

Discovery tăng

Có thể phát sinh tham số

Mở URL mẫu, xác định nguồn sinh URL

SEO/Dev

Crawl tăng, index không tăng

Có thể trùng lặp hoặc nhiều nguyên nhân khác

Đối chiếu Page indexing, URL Inspection trước khi sửa

SEO

Khi crawl tăng hoặc giảm, lúc nào cần hành động?

  • Theo dõi: Biến động có bối cảnh hợp lý, không kèm lỗi.
  • Kiểm tra thêm: Xu hướng kéo dài, chưa giải thích được hoặc phản hồi chậm hơn.
  • Ưu tiên xác minh và xử lý: Lỗi kết nối/5xx diện rộng còn tiếp diễn, hoặc lỗi hạ tầng ngăn lấy robots.txt.

Không chuyển hướng mọi 404 về trang chủ. Không sửa robots.txt, canonical (tín hiệu URL đại diện) hoặc chuyển hướng chỉ vì một biến động ngắn hạn. Hai sự kiện xảy ra gần nhau chưa chứng minh quan hệ nhân quả.

Sơ đồ năm bước từ Host Status đến đối chiếu URL mẫu

Những hiểu lầm phổ biến khi đọc Crawl Stats và crawl budget

Crawl budget liên quan cả khả năng và nhu cầu thu thập của Google, không phải hạn mức cố định website được cấp.

  1. “Crawl nhiều thì thứ hạng cao”: Lượt yêu cầu thu thập dữ liệu (crawl requests) phản ánh mức độ hoạt động của Googlebot trên máy chủ, không phải là yếu tố đo lường hay trực tiếp quyết định thứ hạng từ khóa.
  2. “Crawl thành công là được index”: Phản hồi thành công chỉ xác nhận khả năng tải; Google còn đánh giá nội dung và các tín hiệu khác.
  3. “Crawl giảm luôn là xấu”: Hoạt động thu thập có thể giảm một cách tự nhiên và hợp lý nếu trang web ít thay đổi hoặc đã được tối ưu loại bỏ các URL trùng lặp, dư thừa.
  4. “noindex ngăn crawl”: Thẻ noindex là chỉ thị không lập chỉ mục; Google cần truy cập trang để đọc được chỉ thị đó.
  5. “robots.txt xóa URL khỏi chỉ mục”: Tệp kiểm soát truy cập thu thập; URL bị chặn vẫn có thể được biết đến qua nguồn khác.
  6. “Website nào cũng phải ưu tiên crawl budget”: Website nhỏ, ổn định thường nên tập trung khả năng truy cập, cấu trúc và nội dung trước.
  7. “Requests CSS/JavaScript cao thì nên chặn”: Chặn tài nguyên thiết yếu có thể khiến Google không hiểu đầy đủ nội dung hiển thị.
  8. “Có benchmark chung cho mọi website”: Thời gian phản hồi, tỷ lệ tệp và requests phải được đọc theo lịch sử, quy mô và cấu trúc.
Thẻ so sánh robots.txt kiểm soát crawl, noindex chỉ thị index và canonical gợi ý URL đại diện.

Checklist kiểm tra Crawl Stats trong 10 phút

10 phút chỉ dành cho rà soát ban đầu, không bảo đảm chẩn đoán hoặc khắc phục mọi lỗi.

  • Property và khoảng thời gian có đúng không?
  • Host Status ghi trạng thái, lỗi nào?
  • Kết nối hiện tại có bất thường không?
  • Ba chỉ số thay đổi cùng nhau thế nào?
  • Có 5xx, 429 hoặc lỗi chuyển hướng tăng không?
  • URL quan trọng có trả 404 ngoài chủ đích không?
  • Discovery tăng có kèm URL tham số không?
  • Sitemap và internal link có trỏ URL không cần thiết không?
  • Có thay đổi hosting, CDN hoặc CMS không?
  • Đã đối chiếu Page indexing, URL Inspection hoặc logs khi cần chưa?
Ghi đầu ra thành ba mục: Vấn đề nghi ngờ, bằng chứng cần bổ sung, người phụ trách.

Tình huống minh họa: Website thiết bị công nghiệp bổ sung bộ lọc công suất; requests và Discovery cùng tăng. Giả thuyết là bộ lọc sinh thêm URL.

SEO cần kiểm tra URL mẫu, liên kết nội bộ, sitemap, canonical và Page indexing. Nếu xác nhận nhiều biến thể không cần thiết, phối hợp Developer hạn chế nguồn sinh và chuẩn hóa liên kết. Mục tiêu là ưu tiên URL có giá trị, không giảm crawl bằng mọi giá.

Checklist dạng bảng, kèm cột bằng chứng và người phụ trách; nội dung tương ứng checklist trên.

Câu hỏi thường gặp

Báo cáo Crawl Stats trong Google Search Console là gì?

Crawl Stats là báo cáo thống kê lịch sử hoạt động của Googlebot trên website của bạn trong 90 ngày gần nhất. Công cụ này giúp bạn theo dõi khả năng truy cập của Google, phát hiện các lỗi kết nối máy chủ và hiểu cách Google phân bổ lượt thu thập dữ liệu trên trang web.

Website nào nên thường xuyên theo dõi báo cáo Crawl Stats?

Báo cáo này đặc biệt quan trọng với các website thương mại điện tử lớn, trang tin tức có tần suất cập nhật cao hoặc các website B2B sở hữu danh mục sản phẩm phức tạp với nhiều bộ lọc. Các trang web ổn định có quy mô nhỏ có thể kiểm tra định kỳ hoặc sau khi thay đổi hạ tầng lớn.

Có nên chặn Googlebot thu thập dữ liệu bằng robots.txt để tiết kiệm ngân sách?

Không nên lạm dụng cách này. Bạn chỉ nên dùng tệp robots.txt để chặn Google truy cập các trang không có giá trị (như trang quản trị hoặc trang tìm kiếm nội bộ). Việc chặn bừa bãi các trang quan trọng có thể làm Google ngừng thu thập dữ liệu toàn bộ website và gây ảnh hưởng nghiêm trọng đến quá trình lập chỉ mục.

Mã phản hồi 404 trong báo cáo Crawl Stats có phải luôn là lỗi nghiêm trọng?

Không hẳn. Nếu các URL bị lỗi 404 là nội dung đã cũ, không còn tồn tại hoặc đã bị xóa chủ đích, đây là phản hồi hoàn toàn bình thường. Tuy nhiên, nếu đó là các trang quan trọng hoặc trang dẫn đến doanh thu, bạn cần kiểm tra lại liên kết nội bộ và thiết lập chuyển hướng phù hợp.

Average response time trong báo cáo có phải là tốc độ tải trang của người dùng?

Không. Đây là thời gian phản hồi của máy chủ dành riêng cho yêu cầu từ Googlebot, không phải là chỉ số trải nghiệm người dùng như Core Web Vitals. Mặc dù vậy, thời gian phản hồi quá cao (>2.000ms) kéo dài có thể khiến Googlebot giảm tần suất thu thập dữ liệu trên website của bạn.

Làm thế nào để xử lý khi thấy cảnh báo về Host Status?

Khi Host Status hiển thị cảnh báo, bạn cần kiểm tra ba yếu tố: khả năng truy cập tệp robots.txt, lỗi phân giải DNS và kết nối máy chủ. Hãy phối hợp với đội ngũ kỹ thuật hoặc đơn vị quản lý hosting để rà soát các thay đổi gần đây về cấu hình tường lửa, dịch vụ CDN hoặc lịch deploy website.

Xem thêm:

Kết luận

Đọc Crawl Stats trong Google Search Console nên bắt đầu từ Host Status, sau đó đến ba chỉ số tổng quan, phản hồi và URL mẫu. Trình tự này giúp nhận diện bất thường mà không nhầm số lượt Googlebot truy cập với số trang được lập chỉ mục.

Trước khi thay đổi cấu hình, hãy đối chiếu lịch triển khai, tình trạng truy cập hiện tại và dữ liệu URL cụ thể. Một biểu đồ riêng lẻ chưa đủ xác định nguyên nhân. Sử dụng checklist Crawl Stats ngay trong bài để ghi bằng chứng và phân công bước kiểm tra tiếp theo.

Đánh giá bài viết

Bài viết này hữu ích thế nào?

Chưa có đánh giá

Bài viết liên quan