Ce que Google fait de votre balisage

Trois faits qui changent la façon de travailler le HTML. Google puise le titre affiché dans neuf sources différentes, et n'utilise la balise title telle quelle que dans environ 87 % des cas depuis 2021. La méta description n'est pas un critère de classement et sert uniquement d'accroche. Et Googlebot ne lit que les deux premiers mégaoctets d'un fichier. Le reste du travail porte sur la structure, pas sur la validité du code.

La balise title, et les huit autres sources

Code source d'une page affiché dans un éditeur

C'est le point le plus mal compris du référencement on-page, parce que la règle a changé en août 2021 et que beaucoup de conseils datent d'avant.

Google ne se contente plus de reprendre la balise title. Sa documentation liste les sources dans lesquelles il puise pour composer le lien de titre affiché dans les résultats.

SourceCe qu'il faut en tirer
La balise <title>Reste la source principale, utilisée telle quelle dans environ 87 % des cas depuis le changement de 2021
Le titre principal affiché sur la pageVotre h1 visible peut se retrouver dans les résultats à la place du title
Les éléments de titre, dont les h1Raison de plus pour que le h1 soit une vraie phrase, pas un mot
La balise og:titleRarement pensée comme un enjeu SEO, elle en est un
Tout contenu grand et proéminent par son styleUn gros texte en haut de page peut être pris pour le titre
D'autres textes de la pageLe filet de sécurité quand rien d'autre ne convient
Le texte d'ancre présent sur la page
Le texte des liens qui pointent vers la pageCe que d'autres sites écrivent pour vous décrire peut vous être attribué
Les données structurées WebSiteSert surtout au nom du site

Pourquoi Google remplace votre titre. Sa documentation cite des cas précis : un titre incomplet, une information périmée, une description inexacte du contenu, un titre principal peu clair, ou une langue différente de celle de la page. La documentation ne cite pas le cas le plus fréquent que je rencontre en audit, le titre générique répété sur tout le site, du type « Accueil | Nom de l'entreprise » décliné sur trois cents pages. Google le remplace parce qu'il ne distingue rien, et il a raison.

La conséquence pratique est simple : un titre remplacé n'est pas une punition, c'est un signal de diagnostic. Comparez régulièrement ce que vous avez écrit à ce qui s'affiche dans les résultats, et traitez chaque écart comme une information sur ce que Google n'a pas trouvé assez clair. Voir la balise title.

La méta description, et ce qu'elle ne fait pas

Elle n'est pas un critère de classement, et elle ne l'est plus depuis très longtemps. Google l'utilise, quand elle lui convient, comme texte affiché sous le titre. Il la remplace fréquemment par un extrait de la page qui correspond mieux à la requête, ce qui est souvent une bonne chose, un extrait contextuel répondant mieux qu'une phrase générique.

Ce qui reste vrai malgré tout, et qui justifie de l'écrire :

Sur la longueur, aucun compte de caractères ne fait autorité, parce que l'affichage dépend de la largeur en pixels et de l'appareil. Un repère raisonnable est de placer l'essentiel dans les cent quarante premiers caractères, le reste étant susceptible d'être coupé. Voir la méta description.

SEO technique

Un doute sur la santé technique de votre site ?

Ce genre de problème se voit rarement à l'œil nu et coûte des positions pendant des mois. Dans mes accompagnements, je commence par vérifier gratuitement l'exploration, l'indexation, la vitesse et les redirections, puis je traite les priorités une par une. Comptez de 300 à 1 500 € par mois selon le périmètre.

Je regarde votre site avant de répondre. Réponse sous 24 h en semaine.

La structure, qui compte plus que les balises

Le HTML sémantique consiste à utiliser les éléments pour ce qu'ils désignent plutôt que pour l'apparence qu'ils donnent. C'est ce qui permet à une machine de distinguer le contenu principal de la navigation, et à un lecteur d'écran d'annoncer la structure.

ÉlémentCe qu'il désigneCe qu'on trouve à la place
<main>Le contenu principal, unique dans la pageUn div avec une classe, indistinguable du reste
<article>Un contenu autonome, qui aurait du sens seulRien, ou un enchaînement de div
<nav>Un bloc de navigationUne liste de liens sans indication de rôle
<h1> à <h6>Le plan du documentDes div stylés en gros, invisibles pour la structure
<a href>Un lien que le moteur peut suivreUn span avec un gestionnaire de clic, que rien ne suit

Le dernier cas coûte cher et reste invisible à l'œil. Un élément cliquable qui n'est pas une balise a avec un attribut href n'est pas un lien pour Google : il ne le suit pas, et la page cible peut se retrouver orpheline. Cela arrive régulièrement dans les menus construits en JavaScript. Voir la page orpheline.

Les titres de niveau, sans mythologie

Deux idées reçues à écarter, et une règle à garder.

Un seul h1 n'est pas une obligation. Google l'a dit à plusieurs reprises : plusieurs h1 ne posent pas de problème. Garder un seul h1 reste préférable, pour la lisibilité du plan et pour les lecteurs d'écran, pas pour le classement.

Placer le mot-clé dans le h1 ne suffit pas, et le répéter dans tous les h2 est contre-productif. Un plan de page qui répète six fois la même expression est un plan qui ne dit rien de la progression du contenu.

L'ordre compte davantage. Ne pas sauter de niveau, du h2 au h4 par exemple, et faire en sorte que chaque titre décrive réellement ce que contient sa section. Le test est simple : lisez uniquement vos titres, dans l'ordre. Si le sommaire ainsi obtenu se comprend seul, la structure est bonne. Voir les balises Hn.

La limite de deux mégaoctets

Point technique peu connu et facile à vérifier. La documentation de Googlebot indique que le robot ne récupère que les deux premiers mégaoctets d'un fichier pris en charge, que la limite porte sur les données non compressées, et que chaque ressource référencée dans la page est soumise à la même contrainte. Les PDF font exception, avec soixante-quatre mégaoctets.

Deux mégaoctets de HTML, c'est considérable, et pourtant certaines pages y arrivent : catalogues générés avec l'intégralité des données en ligne, pages de résultats internes sans pagination, gabarits qui embarquent un état applicatif complet en JavaScript. Si votre contenu principal se trouve après ce seuil, il n'existe pas pour l'index. La vérification tient en une commande ou un coup d'œil au poids du document dans l'onglet réseau.

Les erreurs de balisage qui comptent vraiment

Le validateur du W3C remonte des centaines d'avertissements sur à peu près n'importe quel site en production, et l'immense majorité n'a aucune conséquence. Google et les navigateurs corrigent silencieusement. Voici les erreurs qui, elles, changent ce que le moteur lit.

  1. 1. Une balise de bloc jamais fermée

    Un div ou une section non fermée peut avaler la suite de la page dans un conteneur inattendu, et déplacer du contenu là où il ne devrait pas être. C'est l'erreur la plus coûteuse et la plus facile à détecter automatiquement.

  2. 2. Un lien imbriqué dans un autre lien

    Le HTML l'interdit, et le navigateur répare en coupant. Le résultat est imprévisible et l'un des deux liens disparaît généralement.

  3. 3. Un attribut mal échappé

    Une apostrophe non échappée dans un attribut délimité par des apostrophes coupe l'attribut, et souvent tous les suivants. Cela produit régulièrement des titres tronqués et des méta descriptions absurdes que personne ne voit à l'écran.

  4. 4. Une canonique qui pointe ailleurs

    Erreur de gabarit classique : toutes les pages déclarent la même URL canonique, souvent celle de l'accueil. Le site entier se retrouve alors dédupliqué sur une seule page. Voir la balise canonique.

  5. 5. Une balise noindex oubliée après une mise en ligne

    Héritée de la préproduction, elle désindexe le site en quelques jours. C'est la première chose à vérifier après toute mise en ligne. Voir la préproduction.

Le contrôle HTML que je fais en dix minutes

Pas un passage au validateur, qui noie l'essentiel sous le décoratif. Un crawl du site, et cinq colonnes à trier. Les title vides ou dupliqués, les méta descriptions dupliquées, les pages sans h1, les canoniques qui ne pointent pas sur la page elle-même, et les balises noindex. Ces cinq colonnes remontent la quasi-totalité des problèmes de balisage qui ont une conséquence réelle, et elles se lisent en dix minutes. Le reste des avertissements de validation peut attendre indéfiniment.

Les données structurées, à leur juste place

Le balisage Schema.org ne fait pas monter une page dans les résultats. Il permet des affichages enrichis, ce qui est différent et parfois plus rentable : une note en étoiles, un fil d'Ariane, une FAQ dépliable, une recette avec sa durée.

Deux règles seulement, et elles suffisent. Le balisage doit décrire ce qui est réellement visible sur la page, et une FAQ balisée dont les questions n'apparaissent nulle part dans le HTML est une violation des consignes. Et il doit rester synchronisé avec le contenu quand la page est modifiée, ce qui est le point qui casse le plus souvent lors des mises à jour. Voir les rich snippets.

Questions fréquentes

Pourquoi Google n'affiche-t-il pas ma balise title ?
Parce qu'il ne s'engage pas à le faire. Depuis le changement de système d'août 2021, Google indique utiliser la balise telle quelle dans environ 87 % des cas, et puiser dans neuf sources différentes le reste du temps : le titre principal affiché, les titres de niveau, la balise og:title, le texte d'ancre des liens qui pointent vers la page, entre autres. Il remplace surtout quand le title est vague, tronqué, générique sur tout le site, ou rédigé dans une autre langue que la page.
La méta description est-elle un critère de classement ?
Non, et elle ne l'est plus depuis très longtemps. Son rôle est de fournir le texte affiché sous le titre dans les résultats, et Google le remplace fréquemment par un extrait de la page qui correspond mieux à la requête. Elle reste utile parce qu'elle influence le taux de clic quand elle est reprise, mais c'est un travail d'accroche commerciale, pas d'optimisation.
Faut-il un seul h1 par page ?
Google a indiqué à plusieurs reprises que plusieurs h1 ne posent pas de problème pour lui. Un seul h1 reste préférable pour une autre raison, qui n'est pas le classement : la clarté du plan de la page pour les lecteurs d'écran, et pour vous quand vous relisez. Ce qui compte davantage est l'ordre : ne pas passer d'un h2 à un h4, et que chaque titre décrive réellement la section qu'il ouvre.
Un HTML invalide pénalise-t-il le référencement ?
Pas en tant que tel. Les navigateurs et Google corrigent la plupart des erreurs de syntaxe silencieusement, et un site truffé d'avertissements du validateur peut très bien se positionner. Ce qui compte, ce sont les erreurs qui changent la structure lue : une balise de bloc jamais fermée qui avale la moitié de la page, un lien imbriqué dans un autre lien, ou un attribut mal échappé qui coupe l'attribut suivant.
Google lit-il toute ma page ?
Pas au-delà d'une certaine taille. La documentation de Googlebot indique que le robot ne récupère que les deux premiers mégaoctets d'un fichier pris en charge, la limite portant sur les données non compressées, avec une exception à soixante-quatre mégaoctets pour les PDF. Deux mégaoctets de HTML représentent un document énorme, mais des pages générées automatiquement avec des milliers de lignes de données en ligne peuvent s'en approcher.

Sources