Ngân sách Crawl: Nó là gì và khi nào bạn thực sự cần lo lắng về nó
Ngân sách crawl là một hạn chế thực sự đối với các trang web lớn và hoàn toàn không phải vấn đề đối với các trang web nhỏ — đây là cách xác định bạn thuộc loại nào trước khi dành thời gian tối ưu hóa cho nó.
Ngân sách crawl thực sự là gì
Ngân sách crawl là sự kết hợp của hai yếu tố: crawler của Google sẵn sàng thực hiện bao nhiêu yêu cầu đến máy chủ của bạn mà không làm quá tải nó, và Google thực sự muốn crawl trang web của bạn đến mức nào dựa trên mức độ phổ biến và tần suất nội dung thay đổi. Nó quyết định bao nhiêu phần của một trang web lớn được crawl, và nhanh đến mức nào, trong bất kỳ ngày nào cho trước — không phải liệu một trang cụ thể có thể được lập chỉ mục hay không.
Thực tế mà hầu hết các trang web cần biết
Đối với một trang web có vài nghìn URL trở xuống, ngân sách crawl gần như không bao giờ là nút thắt cổ chai thực sự — Google nhìn chung có thể crawl một trang web cỡ đó gọn trong một ngày ngay cả khi không có bất kỳ tối ưu hóa nào. Nếu một trang trên một trang web nhỏ không được lập chỉ mục, nguyên nhân nhiều khả năng hơn nhiều là chất lượng nội dung, một rào cản kỹ thuật, hoặc khả năng khám phá (không có liên kết nội bộ trỏ đến nó) — xem vì sao Google không lập chỉ mục trang web của bạn trước khi cho rằng ngân sách crawl là vấn đề.
Khi nào nó thực sự quan trọng
- Các trang web lớn — hàng chục nghìn URL trở lên — nơi crawler đơn giản không thể tiếp cận mọi trang thường xuyên như bạn muốn.
- Các trang web có điều hướng theo thuộc tính nặng hoặc tham số URL (thứ tự sắp xếp, bộ lọc, ID phiên) nhân một số ít trang thực sự thành một số lượng khổng lồ các URL gần như trùng lặp có thể crawl.
- Các trang web xuất bản hoặc cập nhật nội dung đủ thường xuyên để độ mới khi crawl lại, chứ không chỉ khám phá ban đầu, mới là mục tiêu thực sự.
Cách kiểm tra xem đó có thực sự là nút thắt cổ chai của bạn không
Mở Cài đặt → Số liệu thống kê crawl trong Search Console và so sánh số trang được crawl trung bình mỗi ngày với tổng số URL có thể lập chỉ mục của bạn. Nếu trang web của bạn có 200.000 URL và Google đang crawl 2.000 mỗi ngày, ngân sách là một hạn chế thực sự. Nếu bạn có 300 URL, thì không phải vậy — bất kể biểu đồ số liệu thống kê crawl trông như thế nào.
Cách khắc phục cho các trang web thực sự bị hạn chế
- Chặn các tổ hợp tham số giá trị thấp và các URL lọc/sắp xếp vô hạn trong robots.txt — xem robots.txt so với noindex.
- Hợp nhất các URL gần như trùng lặp bằng thẻ canonical thay vì để Google crawl và đánh giá riêng từng biến thể — xem nội dung trùng lặp và thẻ canonical.
- Khắc phục thời gian phản hồi máy chủ chậm — một máy chủ nhanh hơn trực tiếp nâng giới hạn tốc độ crawl mà Google sẵn sàng sử dụng.
- Cắt bỏ hoặc đặt noindex cho các trang thực sự sơ sài, giá trị thấp đang tiêu tốn sự chú ý của crawl mà không bao giờ đáng để xếp hạng.
Ngân sách crawl không phải là đòn bẩy duy nhất cho nội dung mới
Việc chờ crawler ưu tiên một URL mới hoặc đã cập nhật theo lịch riêng của nó chính xác là hạn chế mà ngân sách crawl mô tả. IndexNow né tránh điều đó cho các URL quan trọng nhất, bằng cách thông báo trực tiếp cho các công cụ tìm kiếm hỗ trợ ngay khi một trang sẵn sàng thay vì chờ được crawl lại và xem xét lại theo lịch của họ. Xem cách lập chỉ mục một bài viết mới nhanh chóng để biết phiên bản từng bước.
Muốn trang tiếp theo của bạn được tìm thấy nhanh hơn so với việc chỉ chờ crawl tự nhiên?
IndexLaunch đẩy trực tiếp mọi URL bạn gửi đến Bing, Yandex, Seznam và Naver thông qua IndexNow ngay khi bạn đưa vào hàng đợi.
Xem bảng giá