IndexLaunch
← Tous les Guides

Bonnes pratiques du sitemap XML pour une indexation plus rapide et plus propre

Quoi inclure, quoi exclure, les limites de taille, et les erreurs de sitemap qui gaspillent silencieusement le budget de crawl.

Un sitemap est une indication, pas une garantie

Les moteurs de recherche traitent un sitemap comme un signal de découverte fort, pas comme un ordre. Il ne forcera pas l'indexation de pages de faible qualité — ce qu'il fait, c'est lever tout doute sur les URL que vous considérez comme canoniques et méritant d'être explorées, ce qui compte surtout sur les sites volumineux ou plus récents.

Quoi inclure

  • Uniquement des URL canoniques — la version exacte que vous voulez voir indexée.
  • Uniquement des URL qui renvoient un statut 200 et sont réellement indexables (pas de balise noindex, non bloquées par robots.txt).
  • Une date lastmod précise — ne la mettez à jour que lorsque le contenu de la page change de façon significative, pas à chaque déploiement.

Quoi exclure

  • Les pages avec une balise noindex — en inclure une dans un sitemap envoie un signal contradictoire.
  • Les URL en redirection ou en 404 — celles-ci sont signalées comme erreurs de sitemap au lieu d'aider à la découverte.
  • Les variantes dupliquées ou paramétrées d'une même page (ordres de tri, ID de session, paramètres de suivi) — ne listez que la version canonique.
  • Les pages pauvres et générées automatiquement avec peu de contenu unique — elles sont une cause fréquente de « Explorée - actuellement non indexée », et en inclure des centaines dilue le signal du sitemap pour les pages qui comptent.

Limites de taille

Un seul fichier sitemap est plafonné à 50 000 URL et 50 Mo non compressés. Les sites plus volumineux ont besoin d'un fichier d'index de sitemaps — un fichier qui répertorie plusieurs sitemaps enfants — plutôt que d'un seul fichier géant. La plupart des frameworks (y compris celui de ce site) le génèrent automatiquement, mais mieux vaut le vérifier si vous en créez un à la main.

Le soumettre et le maintenir

Soumettez-le une fois à la fois dans Google Search Console et Bing Webmaster Tools, et ajoutez une ligne Sitemap: dans votre robots.txt qui y pointe — ainsi, tout robot qui découvre votre site de manière indépendante, sans soumission préalable, pourra aussi le localiser. Ensuite, le sitemap devrait se régénérer automatiquement à mesure que le contenu change ; un sitemap maintenu à la main devient presque toujours obsolète.

Erreurs courantes qui gaspillent silencieusement le budget de crawl

  • Le générer une fois au lancement et ne jamais le mettre à jour à mesure que des pages sont ajoutées ou supprimées.
  • Définir le lastmod de chaque URL à la date du jour à chaque build — cela entraîne les robots à ne plus faire confiance à ce champ comme véritable signal de changement.
  • Oublier de le resoumettre après une restructuration majeure des URL (par exemple une migration de domaine ou un changement de permalien) — Google finira par le remarquer de lui-même, mais le resoumettre accélère la transition.

Envie que votre prochaine page soit trouvée plus vite qu'avec le seul crawl organique ?

IndexLaunch envoie chaque URL que vous soumettez directement à Bing, Yandex, Seznam et Naver via IndexNow dès que vous la mettez en file d'attente.

Voir les tarifs