IndexLaunch
← 全部指南

重复内容与 canonical 标签:它们如何影响收录

为什么近似相同的页面会在收录上相互竞争,以及 canonical 标签如何告诉搜索引擎哪个版本才应该被真正收录和排名。

重复内容很少是完全的复制粘贴

大多数重复内容并非两篇完全相同的文章——而是同一个页面可以通过多个网址访问:带 www 与不带、带结尾斜杠与不带、http 与 https、附加了跟踪或排序参数,或是拥有独立网址的打印友好版本。对爬虫而言,这些都是渲染出相同内容的、彼此独立的网址。

为什么它损害的不只是排名,还有收录本身

一个常见的误解是,重复内容只会在各个版本之间分散排名信号。但实际上,搜索引擎往往会更进一步,直接选择收录其中一个版本,而基本忽略其余版本——而这个选择并不保证正是您真正想要的那个版本。这正是导致页面停留在“已抓取 - 尚未编入索引”状态的一个较常见、却不太容易察觉的原因:页面被爬取了,被识别为与另一个网址等价,然后被直接舍弃,转而收录了那一个。

canonical 标签实际的作用

<link rel="canonical" href="...">会告诉爬虫:可能有多个网址都能到达这里,但这一个特定网址才是应该被收录和赋予权重的版本。每一个可被收录的页面都应携带一个 canonical 标签——包括指向自身的自引用标签——这样就不会对该页面内容自身认定的权威网址产生任何歧义。

它是一种提示,而非指令

搜索引擎将 canonical 标签视为一个强有力的信号,而非绝对规则——这一点与站点地图很相似。如果其他强信号存在分歧(例如,大多数外部反向链接都指向非 canonical 版本),搜索引擎可能会选择收录与您指定不同的网址。当 canonical 标签与页面上其他所有信号保持一致时效果最好:内部链接、站点地图条目和重定向都应指向同一个网址。

常见的 canonical 设置错误

  • 将 canonical 标签指向一个会发生重定向的网址——爬虫必须跟随整条重定向链,给本应消除歧义的信号增加了额外的处理负担。
  • 将 canonical 标签指向一个自身带有noindex 标签的页面——这对相互矛盾的信号可能导致两个版本都未被收录。
  • 在分页系列中 canonical 设置不一致(每一页都指回第一页),而实际上每一页都拥有独有的、值得单独保留并收录的内容。
  • 全站模板存在缺陷,将每一个页面都 canonical 到首页——这种情况少见,但后果严重,值得在任何模板变更后重点核查。

从根源上加以修复

为您的域名确定一种统一的 canonical 形式(是否带 www、是否带结尾斜杠),并在服务器层面将其他所有变体重定向到该形式——canonical 标签只是次要信号,无法替代从一开始就不以 200 响应的形式提供重复网址这件事本身。在这一点保持一致后,还要确保您的站点地图只列出每个页面的 canonical 版本——列出非 canonical 网址,会发出与该页面自身 canonical 标签直接矛盾的信号。

希望您的下一个页面比单纯依靠自然爬取更快被发现?

IndexLaunch 会在您提交网址的那一刻,通过 IndexNow 将其直接推送给 Bing、Yandex、Seznam 和 Naver。

查看价格