← 全部指南
XML 站点地图最佳实践:实现更快、更干净的收录
应包含什么、应排除什么、大小限制,以及那些悄悄浪费爬取预算的站点地图错误。
站点地图是一种提示,而非保证
搜索引擎将站点地图视为一个强有力的发现信号,而非命令。它不会强制收录低质量页面——它真正的作用,是消除关于您认为哪些网址是权威且值得爬取的疑虑,这在大型或较新的网站上尤为重要。
应该包含什么
- 仅包含 canonical 网址——即您希望被收录的确切版本。
- 仅包含返回 200 状态且真正可被收录的网址(没有
noindex标签,未被 robots.txt 屏蔽)。 - 准确的
lastmod日期——仅在页面内容发生实质性变化时更新,而非每次部署都更新。
应该排除什么
- 带有
noindex标签的页面——将其纳入站点地图会发出自相矛盾的信号。 - 发生重定向或返回 404 的网址——这些会被报告为站点地图错误,而非帮助被发现。
- 同一页面的重复或带参数变体(排序方式、会话 ID、跟踪参数)——只列出唯一的 canonical 版本。
- 独有内容极少的、自动生成的单薄页面——这些是“已抓取 - 尚未编入索引”的常见成因,若包含数百个此类页面,会稀释站点地图对真正重要页面的信号强度。
大小限制
单个站点地图文件上限为 50,000 个网址,未压缩大小上限为 50MB。较大的网站需要一个站点地图索引文件——即一个列出多个子站点地图的文件——而非单一的巨型文件。大多数框架(包括本站所使用的)都会自动生成,但如果您是手动编写的,值得确认一下。
提交与维护
在 Google Search Console 和 Bing 网站管理员工具中各提交一次,并在 robots.txt 中添加一行 Sitemap:,指向该站点地图——这样即使爬虫在没有事先提交的情况下独立发现您的网站,也能找到它。此后,站点地图应随内容变化自动重新生成;手动维护的站点地图几乎总是会过时。
悄悄浪费爬取预算的常见错误
- 只在上线时生成一次,之后新增或删除页面时从未更新。
- 每次构建都把所有网址的
lastmod设为当前日期——这会让爬虫逐渐不再信任该字段是真实的变更信号。 - 在大规模网址结构调整(如域名迁移或永久链接格式变更)后忘记重新提交——Google 最终会自行发现,但重新提交能加快过渡速度。