Ce que Google fait de votre balisage
Trois faits qui changent la façon de travailler le HTML. Google puise le titre affiché dans neuf sources différentes, et n'utilise la balise title telle quelle que dans environ 87 % des cas depuis 2021. La méta description n'est pas un critère de classement et sert uniquement d'accroche. Et Googlebot ne lit que les deux premiers mégaoctets d'un fichier. Le reste du travail porte sur la structure, pas sur la validité du code.
La balise title, et les huit autres sources
C'est le point le plus mal compris du référencement on-page, parce que la règle a changé en août 2021 et que beaucoup de conseils datent d'avant.
Google ne se contente plus de reprendre la balise title. Sa documentation liste les sources dans lesquelles il puise pour composer le lien de titre affiché dans les résultats.
| Source | Ce qu'il faut en tirer |
|---|---|
La balise <title> | Reste la source principale, utilisée telle quelle dans environ 87 % des cas depuis le changement de 2021 |
| Le titre principal affiché sur la page | Votre h1 visible peut se retrouver dans les résultats à la place du title |
Les éléments de titre, dont les h1 | Raison de plus pour que le h1 soit une vraie phrase, pas un mot |
La balise og:title | Rarement pensée comme un enjeu SEO, elle en est un |
| Tout contenu grand et proéminent par son style | Un gros texte en haut de page peut être pris pour le titre |
| D'autres textes de la page | Le filet de sécurité quand rien d'autre ne convient |
| Le texte d'ancre présent sur la page | |
| Le texte des liens qui pointent vers la page | Ce que d'autres sites écrivent pour vous décrire peut vous être attribué |
Les données structurées WebSite | Sert surtout au nom du site |
Pourquoi Google remplace votre titre. Sa documentation cite des cas précis : un titre incomplet, une information périmée, une description inexacte du contenu, un titre principal peu clair, ou une langue différente de celle de la page. La documentation ne cite pas le cas le plus fréquent que je rencontre en audit, le titre générique répété sur tout le site, du type « Accueil | Nom de l'entreprise » décliné sur trois cents pages. Google le remplace parce qu'il ne distingue rien, et il a raison.
La conséquence pratique est simple : un titre remplacé n'est pas une punition, c'est un signal de diagnostic. Comparez régulièrement ce que vous avez écrit à ce qui s'affiche dans les résultats, et traitez chaque écart comme une information sur ce que Google n'a pas trouvé assez clair. Voir la balise title.
La méta description, et ce qu'elle ne fait pas
Elle n'est pas un critère de classement, et elle ne l'est plus depuis très longtemps. Google l'utilise, quand elle lui convient, comme texte affiché sous le titre. Il la remplace fréquemment par un extrait de la page qui correspond mieux à la requête, ce qui est souvent une bonne chose, un extrait contextuel répondant mieux qu'une phrase générique.
Ce qui reste vrai malgré tout, et qui justifie de l'écrire :
- Quand elle est reprise, elle décide du clic. C'est un travail d'accroche, avec les mêmes règles que n'importe quelle annonce : dire ce que la page apporte, pas ce qu'elle contient.
- Une description absente est remplie par n'importe quoi. Souvent le début du menu de navigation ou une phrase d'introduction sans intérêt. Écrire la sienne évite ce cas.
- Elle ne doit pas être identique sur plusieurs pages. C'est le signal d'un gabarit qui n'a jamais été renseigné, et la Search Console le remonte.
Sur la longueur, aucun compte de caractères ne fait autorité, parce que l'affichage dépend de la largeur en pixels et de l'appareil. Un repère raisonnable est de placer l'essentiel dans les cent quarante premiers caractères, le reste étant susceptible d'être coupé. Voir la méta description.
Un doute sur la santé technique de votre site ?
Ce genre de problème se voit rarement à l'œil nu et coûte des positions pendant des mois. Dans mes accompagnements, je commence par vérifier gratuitement l'exploration, l'indexation, la vitesse et les redirections, puis je traite les priorités une par une. Comptez de 300 à 1 500 € par mois selon le périmètre.
Je regarde votre site avant de répondre. Réponse sous 24 h en semaine.
La structure, qui compte plus que les balises
Le HTML sémantique consiste à utiliser les éléments pour ce qu'ils désignent plutôt que pour l'apparence qu'ils donnent. C'est ce qui permet à une machine de distinguer le contenu principal de la navigation, et à un lecteur d'écran d'annoncer la structure.
| Élément | Ce qu'il désigne | Ce qu'on trouve à la place |
|---|---|---|
<main> | Le contenu principal, unique dans la page | Un div avec une classe, indistinguable du reste |
<article> | Un contenu autonome, qui aurait du sens seul | Rien, ou un enchaînement de div |
<nav> | Un bloc de navigation | Une liste de liens sans indication de rôle |
<h1> à <h6> | Le plan du document | Des div stylés en gros, invisibles pour la structure |
<a href> | Un lien que le moteur peut suivre | Un span avec un gestionnaire de clic, que rien ne suit |
Le dernier cas coûte cher et reste invisible à l'œil. Un élément cliquable qui n'est pas une balise a avec un attribut href n'est pas un lien pour Google : il ne le suit pas, et la page cible peut se retrouver orpheline. Cela arrive régulièrement dans les menus construits en JavaScript. Voir la page orpheline.
Les titres de niveau, sans mythologie
Deux idées reçues à écarter, et une règle à garder.
Un seul h1 n'est pas une obligation. Google l'a dit à plusieurs reprises : plusieurs h1 ne posent pas de problème. Garder un seul h1 reste préférable, pour la lisibilité du plan et pour les lecteurs d'écran, pas pour le classement.
Placer le mot-clé dans le h1 ne suffit pas, et le répéter dans tous les h2 est contre-productif. Un plan de page qui répète six fois la même expression est un plan qui ne dit rien de la progression du contenu.
L'ordre compte davantage. Ne pas sauter de niveau, du h2 au h4 par exemple, et faire en sorte que chaque titre décrive réellement ce que contient sa section. Le test est simple : lisez uniquement vos titres, dans l'ordre. Si le sommaire ainsi obtenu se comprend seul, la structure est bonne. Voir les balises Hn.
La limite de deux mégaoctets
Point technique peu connu et facile à vérifier. La documentation de Googlebot indique que le robot ne récupère que les deux premiers mégaoctets d'un fichier pris en charge, que la limite porte sur les données non compressées, et que chaque ressource référencée dans la page est soumise à la même contrainte. Les PDF font exception, avec soixante-quatre mégaoctets.
Deux mégaoctets de HTML, c'est considérable, et pourtant certaines pages y arrivent : catalogues générés avec l'intégralité des données en ligne, pages de résultats internes sans pagination, gabarits qui embarquent un état applicatif complet en JavaScript. Si votre contenu principal se trouve après ce seuil, il n'existe pas pour l'index. La vérification tient en une commande ou un coup d'œil au poids du document dans l'onglet réseau.
Les erreurs de balisage qui comptent vraiment
Le validateur du W3C remonte des centaines d'avertissements sur à peu près n'importe quel site en production, et l'immense majorité n'a aucune conséquence. Google et les navigateurs corrigent silencieusement. Voici les erreurs qui, elles, changent ce que le moteur lit.
- 1. Une balise de bloc jamais fermée
Un
divou unesectionnon fermée peut avaler la suite de la page dans un conteneur inattendu, et déplacer du contenu là où il ne devrait pas être. C'est l'erreur la plus coûteuse et la plus facile à détecter automatiquement. - 2. Un lien imbriqué dans un autre lien
Le HTML l'interdit, et le navigateur répare en coupant. Le résultat est imprévisible et l'un des deux liens disparaît généralement.
- 3. Un attribut mal échappé
Une apostrophe non échappée dans un attribut délimité par des apostrophes coupe l'attribut, et souvent tous les suivants. Cela produit régulièrement des titres tronqués et des méta descriptions absurdes que personne ne voit à l'écran.
- 4. Une canonique qui pointe ailleurs
Erreur de gabarit classique : toutes les pages déclarent la même URL canonique, souvent celle de l'accueil. Le site entier se retrouve alors dédupliqué sur une seule page. Voir la balise canonique.
- 5. Une balise
noindexoubliée après une mise en ligneHéritée de la préproduction, elle désindexe le site en quelques jours. C'est la première chose à vérifier après toute mise en ligne. Voir la préproduction.
Le contrôle HTML que je fais en dix minutes
Pas un passage au validateur, qui noie l'essentiel sous le décoratif. Un crawl du site, et cinq colonnes à trier. Les title vides ou dupliqués, les méta descriptions dupliquées, les pages sans h1, les canoniques qui ne pointent pas sur la page elle-même, et les balises noindex. Ces cinq colonnes remontent la quasi-totalité des problèmes de balisage qui ont une conséquence réelle, et elles se lisent en dix minutes. Le reste des avertissements de validation peut attendre indéfiniment.
Les données structurées, à leur juste place
Le balisage Schema.org ne fait pas monter une page dans les résultats. Il permet des affichages enrichis, ce qui est différent et parfois plus rentable : une note en étoiles, un fil d'Ariane, une FAQ dépliable, une recette avec sa durée.
Deux règles seulement, et elles suffisent. Le balisage doit décrire ce qui est réellement visible sur la page, et une FAQ balisée dont les questions n'apparaissent nulle part dans le HTML est une violation des consignes. Et il doit rester synchronisé avec le contenu quand la page est modifiée, ce qui est le point qui casse le plus souvent lors des mises à jour. Voir les rich snippets.
Questions fréquentes
Sources
- Google Search Central, lien de titre : les neuf sources utilisées pour composer le titre affiché, bonnes pratiques et motifs de remplacement.
- Google Search Central, Googlebot : limite de deux mégaoctets par fichier pris en charge et de soixante-quatre mégaoctets pour les PDF, appliquée aux données non compressées.
- Google Search Central, extraits de résultats : rôle de la méta description et conditions dans lesquelles Google la remplace.
- Proportion d'environ 87 % de titres repris tels quels : chiffre communiqué par Google après le déploiement du nouveau système de titres, en août 2021.