← 返回所有指南
爬取預算:它是什麼,以及您何時真正需要在意它
爬取預算對大型網站而言是真實的限制,但對小型網站幾乎完全無關緊要 —— 在花時間為它做最佳化之前,先弄清楚您屬於哪一種。
爬取預算實際上是什麼
爬取預算結合了兩件事:Google 的爬蟲在不造成伺服器過載的前提下,願意對您伺服器發出多少請求;以及根據網站的受歡迎程度與內容更新頻率,Google 實際上有多想爬取您的網站。它決定的是大型網站在任何一天內,會有多少比例被爬取、以及爬取的速度 —— 而不是某個特定頁面能不能被索引。
大多數網站需要的現實檢查
對於網址數量僅有數千個或更少的網站而言,爬取預算幾乎從來不是真正的瓶頸 —— 即使完全沒有做任何最佳化,Google 通常也能在一天之內順利爬完這種規模的網站。若小型網站上的某個頁面未能被索引,更有可能的原因是內容品質、技術性封鎖,或發現問題(沒有內部連結指向它)—— 在認定是爬取預算問題之前,請先參閱為什麼 Google 沒有索引您的網站。
真正重要的時候
- 大型網站 —— 網址數量達數萬個以上 —— 爬蟲根本無法依您期望的頻率造訪每個頁面。
- 有大量分面篩選導覽或網址參數(排序方式、篩選條件、工作階段 ID)的網站,會把少數真實頁面倍增成大量近似重複、可被爬取的網址。
- 發布或更新內容頻率極高的網站,重新爬取以維持內容新鮮度,而不只是初次發現,才是真正的目標。
如何確認這是否真的是您的瓶頸
在 Search Console 中開啟設定 → 爬取統計資料,比較每日平均爬取頁數與您可索引網址的總數。若您的網站有 20 萬個網址,而 Google 每天只爬取 2,000 個,那預算確實是真正的限制。若您只有 300 個網址,那不管爬取統計圖表看起來如何,都不是問題所在。
真正受限網站的修正方式
- 在 robots.txt 中封鎖低價值的參數組合與無限篩選/排序網址 —— 參閱robots.txt 與 noindex 的差異。
- 使用 canonical 標籤整合近似重複的網址,而不是讓 Google 逐一爬取並評估每個變體 —— 參閱重複內容與 canonical 標籤。
- 修正緩慢的伺服器回應時間 —— 更快的伺服器能直接提高 Google 願意採用的爬取速率上限。
- 修剪或為真正單薄、低價值、卻持續消耗爬取資源卻永遠不值得排名的頁面加上 noindex。
爬取預算並非新內容唯一的槓桿
等待爬蟲依自己的排程優先處理新的或更新過的網址,正是爬取預算這項限制所描述的情況。IndexNow 能繞過這項限制,針對最重要的網址,在頁面準備就緒的當下直接通知支援的搜尋引擎,而不必等待它們依自己的時程重新爬取與重新評估。逐步操作方式請參閱如何讓新文章快速被索引。
想讓您的下一個頁面比單靠自然爬取更快被發現嗎?
只要您將網址加入佇列,IndexLaunch 就會立即透過 IndexNow 將其直接推送給 Bing、Yandex、Seznam 和 Naver。
查看價格方案