Ce qu'il faut retenir

Le cloaking, c'est servir au robot un contenu différent de celui vu par l'internaute, dans le but d'influencer le classement. C'est une pratique explicitement visée par les règles anti-spam de Google. Ce qui qualifie la pratique tient à l'intention et à l'écart de contenu, la technique employée n'entrant nulle part dans la définition. Assembler une page sur le serveur, adapter la langue au pays ou masquer un article payant restent donc permis, à condition que le robot ne reçoive rien que l'internaute ne puisse voir.

Texte masqué dans une page web, illustrant la dissimulation de contenu

Historiquement, le cloaking consistait à détecter le robot par son identifiant ou son adresse et à lui servir une page bourrée de mots-clés, pendant que le visiteur recevait une page commerciale. Cette forme a pratiquement disparu, parce qu'elle est facile à détecter et lourdement sanctionnée. Ce qui subsiste est plus subtil, et souvent accidentel.

La définition retenue par Google

Google range la dissimulation parmi ses pratiques de spam et la définit comme le fait de présenter un contenu différent aux moteurs de recherche et aux utilisateurs. Deux mots portent tout le poids de cette définition.

Différent désigne un écart de contenu, pas de forme. Une même page servie avec une mise en page adaptée à l'appareil reste identique au sens qui nous occupe. Le jour où le texte lui-même change selon le visiteur, on entre dans le périmètre.

Utilisateurs désigne les internautes réels. La question à se poser est donc toujours la même : ce que le robot reçoit, un visiteur peut-il l'obtenir ? Si la réponse est oui, il n'y a pas de sujet. Si elle est non, il y en a un, quelle que soit la bonne foi de celui qui a mis en place la configuration.

Les cas involontaires, de loin les plus fréquents

Aucun des cas ci-dessous n'a été mis en place pour manipuler quoi que ce soit. Tous produisent pourtant un écart entre ce que voit le robot et ce que voit le visiteur.

ConfigurationL'écart produitComment le corriger
Protection anti-robotLe pare-feu applicatif sert une page de vérification aux visiteurs automatisés qu'il ne connaît pasAutoriser explicitement les robots légitimes, y compris ceux qui ne sont pas Googlebot
Redirection géographiqueLe robot, souvent localisé aux États-Unis, est renvoyé vers la version anglaise du siteServir la version demandée sans redirection forcée, et déclarer les correspondances de langue
Bandeau de consentement bloquantLe contenu n'est chargé qu'après acceptation, que le robot ne donne jamaisServir le contenu dès la réponse initiale, indépendamment du choix de consentement
Test A/B mal configuréLe robot est systématiquement affecté à une varianteTraiter le robot comme un visiteur ordinaire, sans règle particulière
Article payant non déclaréLe texte complet est servi au robot, un extrait au visiteurPoser le balisage prévu pour les contenus à accès restreint

La protection anti-robot arrive largement en tête des cas que je rencontre. Les listes d'exceptions de ces services contiennent Googlebot par défaut et s'arrêtent souvent là, ce qui laisse tous les autres robots devant une page de vérification qu'ils ne franchiront jamais.

Ce qui reste autorisé

Trois pratiques ressemblent au cloaking sans en être, et il est utile de savoir les défendre.

Le rendu côté serveur et le prérendu. Assembler la page sur le serveur, ou servir une version déjà construite, est une optimisation de livraison. Ce qui compte est l'équivalence du contenu, autrement dit la version livrée doit correspondre à ce que verrait l'internaute une fois la page affichée. C'est la réponse standard au problème des sites en rendu client, traité sur ma page JavaScript et SEO.

La personnalisation. Afficher le prénom d'un visiteur connu, ou remonter des produits déjà consultés, ne pose aucun problème tant que le contenu principal reste le même et que seule sa périphérie s'adapte. La limite se situe au moment où la personnalisation touche le contenu qui justifie le classement de la page.

Les contenus à accès restreint. Un article réservé aux abonnés peut être servi partiellement, à condition de le déclarer avec le balisage prévu. Google accepte alors de ne pas considérer l'écart comme une dissimulation.

Le test qui tranche tous les cas limites. Un internaute peut-il, par un moyen normal, accéder à ce que le robot a reçu ? S'abonner, changer de langue, accepter les conditions, ce sont des moyens normaux. En revanche, si aucun chemin ne mène un visiteur au contenu servi au robot, il s'agit de cloaking, quelle que soit l'intention de départ.

Comment vérifier son propre site

La vérification repose sur la comparaison de trois vues de la même page, et elle prend une dizaine de minutes.

  1. La vue Google. L'inspection d'URL de la Search Console affiche le HTML rendu, celui à partir duquel Google indexe. C'est la référence.
  2. La vue visiteur. Le HTML renvoyé lors d'une consultation ordinaire, sans identification particulière.
  3. La vue robot. Le même appel, en se présentant comme Googlebot. Un écart entre cette vue et la précédente signale une détection d'agent, qu'il faut ensuite expliquer.

Trois vues concordantes closent le sujet. Un écart n'est pas nécessairement une faute, mais il doit être justifiable, et il vaut mieux le découvrir soi-même que par une notification.

Depuis deux ans, j'ajoute un quatrième contrôle, la même requête en se présentant comme l'un des robots des moteurs génératifs. Ces robots n'exécutent pas le JavaScript et se font parfois bloquer par les protections applicatives. Le résultat est souvent une surprise, y compris sur des sites par ailleurs bien tenus.

Trois pratiques voisines qu'on confond souvent

Le mot cloaking sert d'étiquette générique à plusieurs choses qui n'ont ni le même mécanisme ni les mêmes conséquences. La distinction vaut d'être faite, parce qu'elle change le correctif.

Le texte caché. Un contenu présent dans le code mais rendu invisible à l'écran, par une couleur identique au fond, une position hors écran ou une taille nulle. Aucun traitement différencié n'est appliqué au robot ici, puisque tout le monde reçoit la même page, dont une partie n'est lisible que par la machine. C'est une entrée distincte des règles anti-spam, et elle vise aussi les liens.

La redirection trompeuse. Le robot indexe une page, et l'internaute qui clique dans les résultats atterrit ailleurs. Le mécanisme diffère du cloaking classique puisque l'écart porte sur la destination et non sur le contenu servi. L'internaute, lui, subit exactement la même chose, en n'obtenant pas ce qu'on lui avait montré.

Les pages satellites. Des pages quasi identiques créées pour capter chacune une variante de requête, et qui convergent toutes vers la même destination. Rien n'y est dissimulé, et pourtant la logique est parente, puisqu'il s'agit de produire pour le moteur une chose dont l'internaute n'a pas l'usage. C'est la pratique que je rencontre le plus souvent en référencement local, sous la forme de pages ville générées en série.

Ce que vous risquez réellement

Le cloaking figure parmi les pratiques qui déclenchent une action manuelle, c'est-à-dire une sanction décidée par un évaluateur et notifiée dans la Search Console. La notification précise le motif, ce qui est une chance, puisque le problème se trouve identifié et que la procédure de sortie existe.

Dans les cas involontaires, la correction est en général rapide, parce que la cause est technique et unique. Le délai de sortie tient alors davantage au temps de traitement de la demande de réexamen qu'à la complexité du correctif.

Le cas volontaire est autrement plus lourd, parce que la sanction s'accompagne d'une perte de confiance qui dépasse la page concernée. Le sujet est traité plus largement sur ma page consacrée au Black Hat SEO.

Questions fréquentes

Qu'est-ce que le cloaking ?
Le fait de présenter au moteur de recherche un contenu différent de celui présenté à l'internaute, dans le but d'influencer le classement. C'est le critère d'intention qui qualifie la pratique, et servir un contenu différent pour une raison technique légitime n'entre pas dans la définition.
Le rendu côté serveur pour les robots est-il du cloaking ?
Non, tant que le contenu servi est le même. Assembler une page sur le serveur pour la livrer déjà complète est une optimisation de livraison. Le jour où la version robot contient des mots que l'internaute ne voit pas, on bascule dans le cloaking, quelle que soit la technique employée.
Un paywall est-il considéré comme du cloaking ?
Non, à condition de le déclarer. Google prévoit un balisage dédié qui indique quelle partie de la page est en accès libre et laquelle ne l'est pas. Un contenu payant servi intégralement au robot sans cette déclaration, lui, est bien du cloaking.
Adapter le contenu selon le pays est-il autorisé ?
Oui, tant que le robot est traité comme n'importe quel visiteur venu du même endroit. Le problème apparaît quand la détection sert à réserver un traitement particulier au robot, ou quand elle l'empêche d'accéder à des versions du site qu'il devrait pouvoir indexer.
Comment vérifier que mon site ne fait pas de cloaking ?
En comparant trois vues de la même page : le HTML rendu affiché par la Search Console, le HTML brut renvoyé à un visiteur ordinaire, et celui renvoyé quand on se présente comme Googlebot. Si les trois concordent, il n'y a pas de sujet. Tout écart mérite une explication.

Sources