RÉFÉRENCEMENT NATUREL · 9 min

Pages orphelines : les repérer et décider lesquelles relier

Croisez crawl, sitemap et inventaires du site, éliminez les faux positifs puis décidez du traitement de chaque URL isolée.

Une personne compare des maquettes imprimées et un site affiché sur son ordinateur

Pour repérer les pages orphelines, comparez les URL découvertes en suivant les liens de votre site avec celles du sitemap, du CMS et, lorsque vous y avez accès, de Search Console ou des journaux. Les adresses présentes uniquement dans ces autres sources sont des candidates à vérifier, pas des pages à relier automatiquement.

Une page orpheline SEO ne reçoit aucun lien interne explorable détecté dans le périmètre examiné. Avant de corriger son isolement, vérifiez qu’elle existe encore, qu’elle apporte une réponse utile et qu’elle doit être accessible depuis le site. Ce guide détaille cet audit URL par URL ; l’organisation générale des parcours reste traitée dans notre méthode de maillage interne pour un petit site.

Page orpheline, page profonde et page non indexée : trois situations

Une page profonde est accessible par des liens, mais au bout d’un parcours long. Une page orpheline n’a pas de chemin interne détectable depuis les points de départ retenus. Une page non indexée est absente de l’index du moteur : ce statut ne décrit pas, à lui seul, son maillage.

Une URL isolée peut avoir été découverte grâce à un ancien lien, un backlink ou un sitemap. Inversement, une page bien reliée peut ne pas être indexée. Le diagnostic d’une page non indexée répond à cette autre question. Ne concluez donc ni « invisible pour Google » ni « inutile » à partir du seul signalement d’un outil.

Un groupe de pages peut aussi se lier en circuit fermé sans être accessible depuis le reste du site. Ses URL possèdent alors des liens entrants internes, mais l’ensemble forme un îlot isolé. Distinguez ce cas d’une page qui ne reçoit réellement aucun lien.

1. Définir ce que l’audit doit couvrir

Notez le domaine, les sous-domaines inclus, les langues, les points de départ et la date du contrôle. Précisez si l’exploration concerne uniquement les pages publiques, si JavaScript est rendu et si certaines rubriques sont volontairement exclues. Un crawl limité à une catégorie ne permet pas d’affirmer qu’une URL est orpheline sur tout le domaine.

Fixez aussi l’objectif : restaurer l’accès aux pages utiles, nettoyer un inventaire ou examiner les effets d’une refonte. Conservez les exports bruts avec leurs dates et réglages. Ils permettront de distinguer une modification réelle du site d’une différence entre deux configurations d’outil.

2. Constituer plusieurs inventaires d’URL

Aucune source ne décrit seule toutes les pages. Rassemblez celles qui sont disponibles et indiquez les manques dans votre compte rendu.

SourceCe qu’elle apporteLimite à conserver
Crawl depuis l’accueil et les hubsURL accessibles par les liens suivis et pages sources correspondantes.Limites de profondeur, exclusions, rendu ou blocages possibles.
Sitemap XML et ses fichiers enfantsURL déclarées au moteur.Peut être incomplet, périmé ou contenir des erreurs.
CMS ou base du sitePages publiées, statuts et dates de création.Export parfois limité à certains types de contenu.
Search ConsoleURL présentes dans les rapports accessibles sur une période définie.Rapports et exports non exhaustifs ; une absence ne prouve pas l’inexistence.
Statistiques et journauxURL effectivement visitées ou demandées.Historique limité, tracking incomplet, requêtes de robots et anciennes erreurs.

Le sitemap fournit des adresses à examiner ; il ne crée pas de lien de navigation. Google rappelle son rôle et ses limites dans son introduction aux sitemaps. Pour produire et entretenir ce fichier, suivez le guide sitemap XML Google, sans confondre sa lecture avec l’indexation des pages.

3. Séparer le crawl des liens de la découverte par les autres sources

Pour savoir ce que la navigation permet de découvrir, réalisez un crawl qui part de l’accueil et des points d’entrée documentés, sans injecter indistinctement toutes les URL du sitemap. Si l’outil intègre plusieurs sources dans une seule analyse, conservez l’origine de découverte et examinez les liens entrants internes.

Une URL explorée parce que vous l’avez importée manuellement n’est pas devenue accessible depuis la navigation. De même, un lien que la page fait vers elle-même ne prouve pas l’existence d’un chemin depuis une autre page.

Certains outils proposent des rapports dédiés : le tutoriel Screaming Frog sur les pages orphelines explique le rapprochement avec les sitemaps, Analytics et Search Console. Les connecteurs, réglages et données disponibles conditionnent le résultat. Un rapport vide après un crawl incomplet n’est pas une preuve d’absence de pages isolées.

4. Rapprocher les adresses sans effacer les différences utiles

Créez une ligne par URL observée, puis ajoutez les colonnes « vue au crawl », « dans le sitemap », « publiée dans le CMS » et « connue d’une autre source ». Comparez ensuite les candidates absentes du crawl aux liens entrants détectés et à la page réelle.

Retirez les espaces parasites et traitez les fragments de section comme une information séparée lorsque vous comparez des pages HTML ordinaires. Conservez toutefois l’adresse brute. N’effacez pas aveuglément les paramètres, la casse du chemin ou le slash final : selon le site, ils peuvent désigner une autre ressource. Si l’application utilise des routes avec fragments, documentez aussi cette particularité.

Relevez l’URL demandée, la chaîne de redirections, la destination finale et la canonical déclarée. Deux adresses ne doivent être regroupées qu’après vérification. Une canonical différente signale un choix à examiner ; elle ne prouve pas à elle seule que Google a retenu ce choix.

Exemple fictifObservationSuite de l’analyse
/guides/revision-veloDans le CMS et le sitemap, absente du crawl.Vérifier contenu, liens entrants et périmètre du crawl.
/ancien-guideVue dans un ancien rapport, redirigée vers un guide actuel.Contrôler la destination ; ne pas recréer un lien vers l’ancienne URL.
/offre-campagneAccessible directement, volontairement exclue du menu.Confirmer sa fonction et sa politique d’indexation.

Cette comparaison produit une liste de vérification. Elle ne justifie encore ni suppression ni ajout massif de liens.

5. Qualifier chaque candidate et éliminer les faux positifs

Ouvrez l’URL, relevez son statut HTTP, son contenu, ses directives et son rôle. Cherchez ensuite un lien réel depuis une page du site : une catégorie paginée oubliée par le crawl, un menu rendu en JavaScript ou une rubrique exclue peuvent expliquer l’écart.

SituationContrôle décisifInterprétation
Page publique utile, réponse 200, aucun lien retrouvéCrawl complet du périmètre et recherche des pages sources.Orpheline probable à relier après validation.
Nouvelle publicationDate de publication comparée à celle du crawl et aux caches.Écart temporel possible ; vérifier son rattachement puis relancer.
Page volontairement isoléeObjectif confirmé par son responsable.L’isolement peut être conservé et documenté.
Page privée ou en noindexAccès autorisé, directives et finalité réelle.Ne pas l’ajouter au maillage public par automatisme.
RedirectionDestination finale, pertinence et liens vers la nouvelle adresse.Ancienne URL à traiter comme redirection.
404 ou 410Suppression voulue ou panne/erreur de publication.Ce n’est pas une page active à relier telle quelle.
DoublonContenu, paramètres, canonical et intention.Décider de la version à conserver avant le maillage.
Lien visible mais absent du rapportRendu, pagination, robots, exclusions et limites de crawl.Faux positif possible ; corriger la mesure avant la page.

Un élément cliquable peut être inutilisable pour un robot s’il ne contient pas de destination explorable. La documentation Google sur les liens explorables aide à contrôler ce point. Ne présentez pas votre crawl comme une reproduction exacte de ce que Googlebot a vu.

Des maquettes de pages imprimées sont regroupées sur un bureau à côté d’un ordinateur

Illustration : classer les pages par rôle avant de décider lesquelles rattacher.

6. Choisir un traitement URL par URL

La décision dépend de l’utilité du contenu, de sa place dans le site et de son état technique. Commencez par les pages qui servent un besoin réel ou dont l’isolement empêche un parcours important. Sans données de trafic, notez cette limite au lieu d’assimiler « non mesuré » à « sans valeur ».

DécisionQuand la choisirAction à vérifier
Ajouter un lien interneContenu distinct et utile, cité naturellement par une page existante.Insérer le lien dans le passage pertinent et tester la destination.
Rattacher à un hub ou une catégoriePage qui appartient à une collection utile mais en est absente.Vérifier catégorie, pagination et accès depuis un point d’entrée.
FusionnerDeux contenus répondent au même besoin sans différence suffisante.Conserver les apports utiles et décider de l’URL finale.
RedirigerAncienne page remplacée par un équivalent pertinent.Redirection directe vers l’équivalent et mise à jour des références.
Conserver en noindexPage publique utile à un parcours particulier, sans vocation à apparaître en recherche.Confirmer la directive et son exclusion du sitemap destiné à l’indexation.
SupprimerContenu définitivement inutile, sans remplacement adapté.Suppression justifiée, statut 404 ou 410 approprié et nettoyage des références.
Ne rien changerIsolement volontaire confirmé ou faux positif de l’audit.Conserver la justification et, si nécessaire, corriger le crawl.

La méthode de diagnostic de cannibalisation permet d’examiner les conflits d’intention avant une fusion. N’utilisez pas une redirection vers l’accueil comme solution générale. Les codes HTTP documentés par Google décrivent des états différents : une 410 correspond à une suppression définitive, pas à une pénalité à appliquer à toute page isolée.

Une page privée doit être protégée par un contrôle d’accès. noindex n’est pas une protection de confidentialité et doit pouvoir être lu par le moteur pour agir ; consultez la documentation sur le blocage de l’indexation. Ne rendez pas publique une page réservée pour améliorer un score de crawl.

7. Appliquer la correction au bon endroit

Pour relier une page, partez d’un contenu déjà accessible qui aborde le besoin correspondant. Un guide central peut introduire la ressource spécialisée ; une catégorie peut intégrer une fiche qui lui appartient. Un lien posé dans une autre page isolée ne rétablit pas à lui seul le parcours depuis le reste du site.

Évitez de compenser un défaut d’architecture par des liens dans tous les pieds de page. Vérifiez plutôt la règle de rattachement du CMS : catégorie manquante, gabarit qui omet des publications, pagination interrompue ou navigation supprimée lors d’une refonte.

Après une fusion ou une redirection, mettez à jour les sources pour viser l’URL finale. Si des références pointent vers une erreur, utilisez la procédure pour trouver et corriger les liens cassés. Une correction de maillage et une correction de destination sont deux opérations à suivre séparément.

8. Refaire le crawl et conserver la preuve

Relancez un crawl comparable depuis les mêmes points de départ, sans ajouter manuellement la page corrigée comme nouveau point d’entrée. Confirmez le lien dans le HTML rendu de la page source, sa destination, la réponse finale et le chemin qui conduit désormais au contenu. Pour un îlot de pages, vérifiez l’accès au groupe puis à chaque destination importante.

Votre tableau de suivi peut contenir : URL brute, URL finale, sources d’inventaire, date, statut HTTP, canonical, directive robots, liens entrants détectés, rôle, diagnostic, action, page source modifiée, responsable et résultat du second contrôle. Un changement de réglage du crawl doit être noté pour expliquer les différences.

Un lien nouvellement détecté prouve la correction du parcours observé. Il ne prouve ni l’indexation ni une hausse de classement. Ces résultats se suivent séparément dans Search Console, avec des périodes datées et comparables, lorsqu’un accès est disponible.

Exemple fictif : trois URL, trois décisions différentes

Un atelier de réparation retrouve un guide d’entretien publié mais absent de sa catégorie : il le rattache à la rubrique et ajoute un lien depuis le guide de préparation. Une ancienne fiche redirige déjà vers la prestation actuelle : il corrige seulement les références restantes. Une page de confirmation destinée aux clients est volontairement en noindex : il ne l’ajoute pas à la navigation publique.

Ces décisions ne découlent pas d’un score unique. Elles reposent sur la fonction de chaque URL. L’audit est terminé lorsque les candidates sont qualifiées et les actions vérifiées, y compris les cas où conserver l’état actuel est le bon choix.

Votre site mérite une fiche claire

Présentez votre activité dans la catégorie la plus pertinente, avec une offre en paiement unique dès 4,99 €.

Ajouter mon site