L'essentiel, en trois lignes

Trois étapes s'enchaînent : Google découvre l'adresse, explore la page, puis décide de l'indexer ou non. Cette dernière étape est un jugement de valeur, pas une formalité : une page peut être lue et écartée. Quand cela arrive, aucun réglage technique ne changera rien, et c'est le contenu qu'il faut reprendre.

Les trois étapes, et où ça casse

ÉtapeCe qui se passeCe qui la bloque
1. Découverte Google apprend qu'une adresse existe, par un lien ou par votre sitemap Une page orpheline qu'aucun lien ne mentionne
2. Exploration Un robot vient lire la page et récupérer son contenu Un blocage dans le robots.txt, un serveur qui refuse les robots, une erreur technique
3. Indexation Google analyse, comprend et décide de retenir la page dans son catalogue Une balise noindex, une canonique qui pointe ailleurs, ou un contenu jugé sans valeur suffisante

La confusion la plus coûteuse porte sur la troisième étape. Beaucoup pensent qu'être exploré garantit d'être indexé. C'est faux, et cela explique la majorité des situations où quelqu'un me dit « Google est passé mais ma page n'apparaît pas ». Google est effectivement passé, il a lu, et il a décidé de ne pas retenir.

Le rendu, l'étape intermédiaire qui pose problème

Entre l'exploration et l'indexation s'intercale une étape que peu de gens connaissent : le rendu. Quand une page dépend du JavaScript pour afficher son contenu, Google doit l'exécuter, comme le ferait un navigateur, avant de pouvoir analyser quoi que ce soit.

Cette exécution coûte des ressources, ce qui a deux conséquences pratiques. D'abord, elle n'est pas immédiate : elle peut intervenir bien après la première visite. Ensuite, si elle échoue pour une raison quelconque, Google indexe une page pratiquement vide sans vous prévenir.

Le test qui tranche : affichez le code source d'une page et cherchez-y une phrase que vous voyez à l'écran. Si vous ne la trouvez pas, votre contenu dépend du JavaScript. Cela ne rend pas l'indexation impossible, mais elle devient plus lente et plus fragile. Et pour les robots des moteurs génératifs, qui ne rendent généralement pas les pages, ce contenu est purement invisible : sujet traité sur GEO.

Les motifs de non-indexation, décodés

Le rapport d'indexation de la Search Console donne le motif exact pour chaque page écartée. Ces intitulés sont mal compris, alors voici leur traduction.

IntituléTraductionAction
Explorée, actuellement non indexée « J'ai lu, ça ne m'a pas convaincu » Problème éditorial. Enrichir, fusionner, ou supprimer
Détectée, actuellement non indexée « Je connais l'adresse, je ne suis pas encore venu » Question de priorité : maillage interne et budget de crawl
Autre page avec balise canonique correcte « Vous m'avez dit qu'une autre page fait référence » Vérifier que la canonique est bien voulue
Doublon sans URL canonique sélectionnée « J'ai trouvé plusieurs versions et j'ai choisi seul » Déclarer explicitement votre version de référence
Bloquée par le fichier robots.txt « Vous m'interdisez d'entrer » Vérifier si c'est voulu ou hérité d'une préproduction
Exclue par la balise noindex « Vous me demandez de ne pas indexer » Souvent posé par un gabarit : vérifier sur plusieurs pages du même type
Introuvable, erreur 404 « L'adresse ne répond plus » Rediriger si la page avait de la valeur, sinon laisser en 404

La distinction qui fait gagner des semaines

« Explorée, non indexée » et « détectée, non indexée » se ressemblent et n'ont rien à voir. La première est un refus : Google est venu, a lu, et a jugé. Aucun sitemap, aucune demande d'indexation ne changera cela, il faut améliorer la page. La seconde est une file d'attente : Google n'est pas encore venu, et là le maillage interne et les liens externes accélèrent réellement les choses.

Indexation

Des pages qui n'entrent pas dans l'index ?

Le motif exact est dans votre Search Console, et il se lit en quelques minutes. Encore faut-il distinguer un refus éditorial d'une file d'attente technique.

Faire le diagnostic

Je vous dis ce qu'il faut corriger, et dans quel ordre.

Quand Google juge une page insuffisante

C'est le motif le plus fréquent sur les sites que j'audite, et le plus mal vécu. Il n'y a pourtant rien de personnel : Google indexe des centaines de milliards de pages et n'a aucune raison d'en stocker une de plus si elle n'ajoute rien.

Les cas typiques :

La bonne réaction n'est jamais d'insister techniquement. C'est de décider, page par page : cette page a-t-elle une raison d'exister ? Si oui, il faut l'améliorer sérieusement. Si non, mieux vaut la supprimer ou la fusionner : un site plus petit et plus dense se référence mieux qu'un site large et creux. Voir thin content.

Le budget de crawl, et quand il compte vraiment

Le budget de crawl désigne la quantité de ressources que Google consacre à explorer votre site. C'est un sujet dont on parle beaucoup trop pour les petits sites, et pas assez pour les gros.

Taille du siteLe budget de crawl est-il un sujet ?
Moins de 1 000 pages Non. Travaillez le contenu, vous gagnerez bien davantage
De 1 000 à 10 000 pages À surveiller, surtout si des paramètres d'URL génèrent des variantes
Au-delà de 10 000 pages Oui, c'est un chantier à part entière
Catalogue avec filtres Oui, quelle que soit la taille : les combinaisons explosent vite

Le mécanisme qui pose problème est toujours le même : des adresses générées automatiquement par les filtres, les tris et la pagination consomment l'exploration au détriment des pages qui comptent. Le cas est détaillé sur le référencement PrestaShop, où il est particulièrement aigu. Pour aller au fond du sujet, voir budget de crawl et l'analyse des logs, qui est la seule façon de savoir ce que Googlebot fait réellement chez vous.

Ce qui accélère réellement

Par ordre d'efficacité décroissante, d'après ce que j'observe.

  1. 1. Un lien depuis une page souvent explorée

    Votre page d'accueil, une catégorie active, un article récent. C'est le levier le plus efficace et le plus négligé : les robots suivent les liens, encore faut-il leur en donner.

  2. 2. Un lien externe depuis un site actif

    Particulièrement décisif pour un site neuf. Un seul lien de qualité suffit à amorcer la découverte, il est inutile d'en acheter cinquante.

  3. 3. La demande d'inspection dans la Search Console

    Efficace pour signaler quelques pages importantes. C'est un signalement, pas un bouton d'indexation : une page sans valeur restera écartée quel que soit le nombre de demandes.

  4. 4. Un sitemap propre et déclaré

    Utile surtout sur les gros sites et les pages profondes. Il ne doit contenir ni pages bloquées, ni pages redirigées, ni pages en noindex : les signaux contradictoires nuisent plus qu'ils n'aident.

  5. 5. Un site qui publie régulièrement

    Un site vivant est exploré plus souvent qu'un site figé. C'est un effet lent, mais durable.

Faire retirer une page de l'index

La question se pose aussi souvent dans l'autre sens, et le choix de la méthode compte.

Questions fréquentes

Quelle différence entre exploration et indexation ?
L'exploration est la visite : un robot vient lire votre page. L'indexation est la décision qui suit : Google juge la page digne d'entrer dans son catalogue et de pouvoir être affichée. Une page peut donc être explorée sans jamais être indexée, et c'est un cas très fréquent qui déroute beaucoup de propriétaires de sites. La Search Console distingue explicitement les deux états.
Pourquoi Google refuse-t-il d'indexer certaines pages ?
Le motif le plus fréquent est un jugement de valeur : la page a été lue et jugée insuffisamment utile. Cela apparaît sous l'intitulé « explorée, actuellement non indexée ». Les autres causes sont techniques : blocage par le robots.txt, balise noindex, balise canonique qui désigne une autre page, ou contenu jugé équivalent à une page existante. Le rapport d'indexation donne le motif exact pour chaque page.
Comment accélérer l'indexation de ses pages ?
Trois leviers réellement efficaces : relier la nouvelle page depuis une page déjà souvent explorée de votre site, obtenir un lien externe depuis un site actif, et demander l'inspection de l'URL dans la Search Console. En revanche, aucun de ces leviers ne fera indexer une page que Google juge sans valeur : dans ce cas le problème est éditorial, pas technique.
Qu'est-ce que le budget de crawl et faut-il s'en préoccuper ?
C'est la quantité de ressources que Google consacre à explorer votre site. Sous quelques milliers de pages, le sujet est rarement une contrainte réelle et l'on gagne plus à travailler le contenu. Il devient sérieux sur les gros catalogues, où des milliers d'adresses générées par les filtres et les tris consomment l'essentiel de l'exploration au détriment des pages qui comptent.
Combien de temps faut-il pour qu'une page soit indexée ?
De quelques heures à plusieurs semaines. Sur un site actif et bien maillé, une nouvelle page est souvent prise en compte en quelques jours. Sur un site neuf sans aucun lien entrant, l'attente se compte en semaines. Au-delà d'un mois sans indexation malgré une Search Console configurée, il y a une cause à chercher : le diagnostic est sur mon site n'est pas sur Google.
Une page désindexée puis corrigée peut-elle revenir ?
Oui, il n'y a rien de définitif. Une fois la cause corrigée, blocage levé ou contenu réellement enrichi, Google réévalue la page à sa prochaine visite. Le délai va de quelques jours à quelques semaines selon la fréquence d'exploration de votre site. Attention toutefois : si le motif était un jugement de valeur, une retouche cosmétique ne suffira pas, il faut que la page ait réellement changé.