IndexLaunch
← Tous les Guides

Robots.txt vs Noindex : quelle est la différence (et quand utiliser lequel)

Bloquer une page dans robots.txt et ajouter une balise noindex font des choses très différentes — utiliser le mauvais est une façon courante de laisser accidentellement une page coincée dans les résultats de recherche, ou complètement absente.

Ils résolvent deux problèmes différents

robots.txt contrôle l<em>exploration</em> — si le robot dun moteur de recherche est autorisé à récupérer une URL. Une balise noindex contrôle l<em>indexation</em> — si une page qui <strong>a été</strong> explorée est autorisée à apparaître dans les résultats de recherche. Confondre les deux est lune des façons les plus courantes qu'une page finisse coincée dans les résultats de recherche alors que vous vouliez la faire disparaître, ou invisible alors que vous vouliez justement qu'elle soit trouvée.

Ce que fait réellement robots.txt

Une règle Disallow dans robots.txt demande aux robots bien élevés de ne pas récupérer une URL. Elle ne supprime pas une page déjà indexée. Si Google a indexé une URL avant qu'elle ne soit bloquée — ou l'a trouvée liée depuis ailleurs et a indexé uniquement l'URL et le texte d'ancrage sans jamais récupérer la page — il peut continuer à afficher cette URL dans les résultats indéfiniment, généralement sans titre ni description, car Google respecte le blocage et ne la réexplore jamais pour vérifier.

Ce que fait réellement noindex

Une balise <meta name="robots" content="noindex"> (ou l'en-tête HTTP X-Robots-Tag équivalent) indique explicitement à un robot qui a déjà récupéré la page : vous pouvez lire ceci, ne le mettez simplement pas dans votre index. C'est le moyen fiable de retirer une page des résultats de recherche — mais seulement si le robot est effectivement autorisé à récupérer la page et à voir la balise en premier lieu.

L'erreur classique : bloquer une page que vous mettez aussi en noindex

Si une URL est interdite dans robots.txt et possède une balise noindex, la balise noindex n'est jamais lue — il a été dit au robot de ne pas récupérer la page du tout, donc il ne voit jamais l'instruction présente sur cette page. La page peut rester indexée (si elle l'était déjà, ou si elle est liée depuis ailleurs) sans que Google n'ait aucun moyen de le savoir autrement, puisque la retirer nécessite de lire une balise qu'il lui est interdit de lire. C'est une façon vraiment courante dont les sites laissent accidentellement des pages de faible valeur coincées dans les résultats de recherche pendant des mois.

Quand utiliser robots.txt

  • Gérer le budget de crawl sur les grands sites — en tenant les robots éloignés des chemins à faible valeur et à fort volume (résultats de recherche interne, combinaisons de filtres à facettes) afin qu'ils passent plus de temps sur les pages qui comptent.
  • Bloquer purement et simplement les environnements de staging, les routes d'administration et les endpoints d'API.
  • Les pages que vous ne voulez jamais voir explorées — même pas pour vérifier leur contenu — car l'exploration elle-même consomme des ressources des deux côtés.

Quand utiliser noindex

  • Les pages que vous voulez voir exister et être explorables — pour le maillage interne, pour les utilisateurs, pour la structure du site — mais qui ne doivent jamais apparaître dans les résultats de recherche : archives de tags/catégories, pages paginées au-delà de la première, pages de remerciement.
  • Le contenu pauvre ou dupliqué que vous n'êtes pas prêt à supprimer purement et simplement, où vous voulez qu'il reste accessible aux visiteurs et aux outils internes.
  • Retirer une page déjà indexée — cela ne fonctionne que si la page reste explorable pour que Google puisse effectivement voir la balise.

Règle de décision rapide

Demandez-vous : un robot a-t-il besoin de lire cette page pour savoir quoi en faire ? Si l'instruction dépend du fait que le contenu propre de la page soit vu (comme une balise noindex), robots.txt doit autoriser l'exploration. Si vous voulez empêcher l'exploration elle-même — quel que soit le contenu de la page — robots.txt est le bon outil, et noindex est redondant puisqu'il ne sera de toute façon jamais lu. Pour un contenu explorable et duplicatif plutôt que carrément indésirable, une balise canonical convient souvent mieux que les deux.

Envie que votre prochaine page soit trouvée plus vite qu'avec le seul crawl organique ?

IndexLaunch envoie chaque URL que vous soumettez directement à Bing, Yandex, Seznam et Naver via IndexNow dès que vous la mettez en file d'attente.

Voir les tarifs