IndexLaunch
← 全部指南

爬取预算:它是什么,以及您真正需要担心它的时候

爬取预算对大型网站而言是真实的限制因素,对小型网站而言则完全不是问题——在花时间为它优化之前,先弄清楚自己属于哪一种。

爬取预算究竟是什么

爬取预算是两个因素的结合:Google 的爬虫愿意在不给您服务器造成过大压力的前提下发出多少请求,以及基于网站的受欢迎程度和内容更新频率,Google 究竟有多想爬取您的网站。它决定了在任意一天,一个大型网站有多少内容会被爬取、爬取速度有多快——而不是决定某个特定页面能否被收录。

大多数网站需要的现实认知

对于网址数量在几千个以内的网站来说,爬取预算几乎从来都不是真正的瓶颈——即使不做任何优化,Google 通常也能在一天之内很好地爬取这类规模的网站。如果一个小型网站上的某个页面没有被收录,更可能的原因是内容质量、技术性屏蔽,或是被发现的问题(没有内部链接指向它)——在认定是爬取预算问题之前,先参见为什么 Google 不收录您的网站

真正重要的情况

  • 大型网站——网址数量达到数万或更多——爬虫根本无法按您期望的频率访问到每一个页面。
  • 拥有大量分面导航或网址参数(排序方式、筛选条件、会话 ID)的网站,会把少量真实页面成倍放大为大量近似重复的可爬取网址。
  • 发布或更新内容足够频繁,以至于重新爬取的新鲜度、而不仅仅是初次发现,才是真正目标的网站。

如何检查这是否真的是您的瓶颈

在 Search Console 中打开设置 → 抓取统计信息,将每日平均爬取网页数与您的可收录网址总数进行对比。如果您的网站有 20 万个网址,而 Google 每天只爬取 2,000 个,那么预算确实是一个真实的限制因素。如果您只有 300 个网址,那就不是——无论抓取统计图表看起来如何。

针对真正受限网站的修复方法

  • 在 robots.txt 中屏蔽低价值的参数组合和无限筛选/排序网址——参见robots.txt vs noindex
  • 使用 canonical 标签合并近似重复的网址,而不是让 Google 分别爬取和评估每一个变体——参见重复内容与 canonical 标签
  • 修复缓慢的服务器响应时间——更快的服务器能直接提高 Google 愿意使用的爬取速率上限。
  • 对确实单薄、低价值、却持续消耗爬取关注度却永远不值得排名的页面进行清理或设置 noindex。

爬取预算并非新内容的唯一手段

等待爬虫按自己的时间表优先处理一个新的或更新过的网址,正是爬取预算所描述的那种限制。IndexNow 通过在页面准备就绪的那一刻,直接通知支持它的搜索引擎,而不是等待被重新爬取和重新考虑,从而绕开了这一限制,让最重要的网址不再受此制约。有关具体步骤,请参见如何让新文章快速被收录

希望您的下一个页面比单纯依靠自然爬取更快被发现?

IndexLaunch 会在您提交网址的那一刻,通过 IndexNow 将其直接推送给 Bing、Yandex、Seznam 和 Naver。

查看价格