IndexLaunch
← 全部指南

XML 站点地图最佳实践:实现更快、更干净的收录

应包含什么、应排除什么、大小限制,以及那些悄悄浪费爬取预算的站点地图错误。

站点地图是一种提示,而非保证

搜索引擎将站点地图视为一个强有力的发现信号,而非命令。它不会强制收录低质量页面——它真正的作用,是消除关于您认为哪些网址是权威且值得爬取的疑虑,这在大型或较新的网站上尤为重要。

应该包含什么

  • 仅包含 canonical 网址——即您希望被收录的确切版本。
  • 仅包含返回 200 状态且真正可被收录的网址(没有 noindex 标签,未被 robots.txt 屏蔽)。
  • 准确的 lastmod 日期——仅在页面内容发生实质性变化时更新,而非每次部署都更新。

应该排除什么

  • 带有 noindex 标签的页面——将其纳入站点地图会发出自相矛盾的信号。
  • 发生重定向或返回 404 的网址——这些会被报告为站点地图错误,而非帮助被发现。
  • 同一页面的重复或带参数变体(排序方式、会话 ID、跟踪参数)——只列出唯一的 canonical 版本。
  • 独有内容极少的、自动生成的单薄页面——这些是“已抓取 - 尚未编入索引”的常见成因,若包含数百个此类页面,会稀释站点地图对真正重要页面的信号强度。

大小限制

单个站点地图文件上限为 50,000 个网址,未压缩大小上限为 50MB。较大的网站需要一个站点地图索引文件——即一个列出多个子站点地图的文件——而非单一的巨型文件。大多数框架(包括本站所使用的)都会自动生成,但如果您是手动编写的,值得确认一下。

提交与维护

Google Search Console 和 Bing 网站管理员工具中各提交一次,并在 robots.txt 中添加一行 Sitemap:,指向该站点地图——这样即使爬虫在没有事先提交的情况下独立发现您的网站,也能找到它。此后,站点地图应随内容变化自动重新生成;手动维护的站点地图几乎总是会过时。

悄悄浪费爬取预算的常见错误

  • 只在上线时生成一次,之后新增或删除页面时从未更新。
  • 每次构建都把所有网址的 lastmod 设为当前日期——这会让爬虫逐渐不再信任该字段是真实的变更信号。
  • 在大规模网址结构调整(如域名迁移或永久链接格式变更)后忘记重新提交——Google 最终会自行发现,但重新提交能加快过渡速度。

希望您的下一个页面比单纯依靠自然爬取更快被发现?

IndexLaunch 会在您提交网址的那一刻,通过 IndexNow 将其直接推送给 Bing、Yandex、Seznam 和 Naver。

查看价格