Qu'est-ce qu'une page orpheline ?
Une page orpheline (ou "orphan page" en anglais) est une URL qui existe sur votre site mais vers laquelle aucune autre page interne ne pointe. Elle n'apparaît dans aucun menu, aucun fil d'Ariane, aucun lien contextuel et aucune liste d'articles connexes.
Elle peut tout de même être connue de Google si elle figure dans le sitemap XML ou si des liens externes pointent vers elle. Mais sans ancrage dans la structure interne du site, elle reste fragile et sous-performante.
Pourquoi c'est un problème SEO
Problème de crawl
Google découvre la plupart des pages en suivant les liens internes depuis les pages déjà connues. Une page sans aucun lien entrant a peu de chances d'être crawlée régulièrement, et parfois pas du tout si elle n'est pas dans le sitemap. Si Google ne crawle pas la page, il ne peut pas l'indexer ni la positionner.
Problème d'autorité
Les liens internes transmettent du PageRank interne. Une page orpheline ne reçoit aucune autorité de la part des autres pages du site. Elle part donc avec un handicap significatif par rapport aux pages bien intégrées dans le maillage, même si son contenu est de qualité.
Signal de faible importance
Le nombre de liens internes reçus par une page est un indicateur de son importance relative aux yeux de Google. Une page que personne ne cite en interne envoie le signal qu'elle n'est pas prioritaire. À l'inverse, une page citée depuis de nombreuses pages clés du site est naturellement perçue comme plus importante.
Comment détecter les pages orphelines
Le principe tient en une comparaison. Un crawl ne trouve que les pages atteignables par des liens, donc par définition il ne voit pas les orphelines. Il faut une seconde liste d'URL, obtenue autrement, et regarder ce qui s'y trouve sans figurer dans le crawl.
- Crawler le site
Un crawl complet avec Screaming Frog depuis la page d'accueil donne la liste de toutes les URL accessibles par les liens internes.
- Réunir les URL connues par d'autres canaux
Le sitemap XML, l'export du rapport Performances de la Search Console sur 16 mois (onglet Pages, qui liste toute URL ayant reçu au moins une impression), les pages de destination de Google Analytics, et si possible les journaux du serveur. Le rapport Indexation des pages ne fournit pas la liste complète des URL indexées, son export est plafonné à mille lignes par tableau, d'où l'intérêt de croiser plusieurs sources.
- Comparer
Toute URL présente dans ces listes et absente du crawl est une orpheline candidate. Screaming Frog automatise le croisement. En connectant le sitemap, la Search Console et Google Analytics dans la configuration, puis en lançant l'analyse de crawl, les filtres « Orphan URLs » des onglets Sitemaps, Search Console et Analytics listent directement ces adresses.
- Vérifier chaque candidate
Une URL peut manquer au crawl pour une autre raison, un lien en JavaScript non rendu, un blocage dans le robots.txt, une limite de profondeur. L'outil Inspection d'URL de la Search Console affiche la page référente par laquelle Google a découvert l'adresse, ce qui confirme ou non l'absence de lien interne.
Les orphelines ont presque toujours la même origine. Un article sorti de la pagination de sa catégorie quand celle-ci a été limitée à dix pages, un produit en rupture retiré des listes mais laissé en ligne, une page de destination créée pour une campagne publicitaire et jamais reliée, une ancienne version de page conservée après une refonte. Connaître ces origines aide à savoir où chercher, et à empêcher les prochaines.
Comment corriger une page orpheline
La solution dépend de la nature de la page :
- Page de contenu stratégique : intégrer des liens depuis les pages thématiquement proches, l'ajouter à une rubrique de navigation ou l'inclure dans des listes "Articles liés".
- Page de faible valeur : envisager de la fusionner avec une autre page plus complète, puis rediriger l'ancienne URL.
- Page technique sans valeur SEO : ajouter une balise noindex et exclure l'URL du sitemap pour éviter de gaspiller le budget de crawl.
| Type de page orpheline | Action recommandée |
|---|---|
| Contenu utile mais oublié | Créer des liens internes depuis les pages pertinentes |
| Contenu redondant avec une autre page | Fusionner et mettre en place une redirection 301 |
| Page technique (confirmation, merci…) | Noindex et retrait du sitemap |
| Page obsolète | Supprimer et rediriger vers la page la plus pertinente |
Prévenir les nouvelles orphelines
Dans une architecture de site bien pensée, chaque nouvelle page publiée doit être reliée à au moins une page existante dès sa mise en ligne. Cela peut être formalisé dans un processus de publication : avant de mettre une page en ligne, vérifier qu'au moins deux ou trois pages du site pointent vers elle.
Dans le cas d'un blog ou d'un site de contenu, les articles de la même catégorie, une page de liste thématique et un lien contextuel depuis un article connexe constituent un minimum pour éviter l'isolement.
Pages orphelines et budget de crawl
Les pages orphelines ont un double effet négatif sur le budget de crawl. D'un côté, elles consomment du budget de crawl si Google les atteint via le sitemap, sans rien apporter à la structure du site. De l'autre, les pages importantes qui auraient besoin d'être crawlées fréquemment peuvent ne pas l'être si le budget est gaspillé sur du contenu isolé et peu valorisé.
Le sujet ne concerne que les sites de moyenne et grande taille, Google indiquant que le budget de crawl ne devient une contrainte qu'au-delà d'un million de pages, ou de dix mille pages à contenu quotidien. Un site e-commerce avec des centaines de pages de filtres orphelines générées automatiquement, connues par le sitemap ou par des liens externes, disperse l'exploration sur du contenu dupliqué ou peu utile au détriment de ses pages produits. Sur un site de quelques centaines de pages, le problème des orphelines est celui de l'autorité et de la découverte, pas celui du budget.
La solution combinée est simple : retirer les pages orphelines de faible valeur du sitemap, leur ajouter une balise noindex, et concentrer les liens internes sur les pages qu'on veut voir crawlées régulièrement.
Les pages qui ne reçoivent qu'un ou deux liens
Entre la page orpheline totale et la page bien maillée, il existe une zone grise : les pages qui ne reçoivent qu'un seul lien interne, souvent depuis le sitemap HTML ou un menu de pied de page. Ce sont les "quasi-orphelines". Elles ne sont pas techniquement orphelines, mais elles restent sous-valorisées.
Dans Screaming Frog, la colonne « Inlinks » de l'onglet Internal, triée par ordre croissant, fait remonter toutes les pages qui reçoivent moins de trois liens internes. En retirant de ce compte les liens du menu et du pied de page, présents sur toutes les pages et qui ne disent rien de l'importance d'une adresse, on obtient la vraie liste des pages sous-liées. C'est le point de départ pour décider lesquelles méritent d'être mieux intégrées et lesquelles peuvent être dépréciées.