Ce qu'il faut retenir

Yandexbot est le robot du moteur russe Yandex. Pour un site francophone sans audience dans les zones qu'il couvre, il ne rapporte pratiquement rien et consomme des ressources. La réponse proportionnée consiste à le ralentir, Yandex prenant en compte la directive de délai entre requêtes que Google ignore depuis des années. Et comme tout robot, son identifiant se falsifie, ce qui impose une vérification par l'adresse plutôt que par le nom déclaré.

Schéma de la répartition du budget d'exploration d'un site entre les robots

Yandex est le moteur dominant en Russie, avec une présence notable dans plusieurs pays voisins et en Turquie. Son robot parcourt le web mondial, y compris les sites qui n'ont aucun public dans ces zones. C'est pour cette raison qu'on le rencontre dans les journaux de serveur de sites purement français, souvent en volume.

L'intérêt réel pour un site francophone

Dans la grande majorité des cas, cet intérêt est nul. Yandex ne pèse rien dans les recherches en français, et un travail d'optimisation qui lui serait spécifiquement destiné n'a aucun retour attendu.

Deux situations font exception, et elles sont identifiables sans ambiguïté.

Une audience russophone réelle. Elle se constate dans les données de fréquentation, pas dans les intentions. Si votre outil de mesure remonte des visiteurs venus de ces pays, la question mérite d'être posée.

Une activité tournée vers ces marchés. Export, tourisme réceptif, services aux expatriés. Là, Yandex devient une destination à part entière, avec ses propres outils pour webmasters et ses propres règles.

Hors de ces deux cas, il ne reste que la question de la charge serveur, qui relève de l'hébergement et se traite avec l'hébergeur.

La charge d'exploration, le vrai sujet

Yandexbot explore volontiers, et sur un site un peu volumineux il peut représenter une part significative des requêtes reçues. Sur un hébergement mutualisé d'entrée de gamme, cela se traduit par un temps de réponse dégradé aux mauvais moments, y compris pour les visiteurs humains et pour Googlebot.

Comptez avant de bloquer. Regardez les journaux de votre serveur sur sept jours et relevez ce que chaque robot représente. Beaucoup d'éditeurs bloquent par principe, sans avoir jamais mesuré la part réelle de qui que ce soit. Il arrive que Yandexbot pèse moins lourd que trois outils d'aspiration inconnus qui, eux, ne servent à personne.

SEO technique

Un doute sur la santé technique de votre site ?

Ce genre de problème se voit rarement à l'œil nu et coûte des positions pendant des mois. Dans mes accompagnements, je commence par vérifier gratuitement l'exploration, l'indexation, la vitesse et les redirections, puis je traite les priorités une par une. Comptez de 300 à 1 500 € par mois selon le périmètre.

Je regarde votre site avant de répondre. Réponse sous 24 h en semaine.

Ralentir plutôt que bloquer

C'est l'option que je recommande dans la plupart des cas, et elle repose sur une particularité commode. Yandex prend en compte la directive de délai entre requêtes dans le fichier robots.txt. Google l'ignore depuis longtemps, ce qui fait oublier qu'elle reste opérante ailleurs.

Concrètement, une section dédiée à Yandexbot avec un délai de quelques secondes entre deux requêtes ramène la charge à un niveau négligeable, tout en laissant le site accessible. C'est un réglage d'une ligne, réversible, et qui ne prend aucune décision irréversible sur votre visibilité.

SituationDécisionPourquoi
Audience nulle dans les zones couvertes, charge faibleNe rien faireLe coût est inférieur au temps qu'on passerait à s'en occuper
Audience nulle, charge visible sur le serveurRalentirRéversible, proportionné, sans conséquence sur la visibilité
Audience nulle, charge réellement gênanteBloquerRien à perdre, et le serveur respire
Audience réelle ou marché viséAccueillir et déclarer le siteYandex propose ses propres outils pour webmasters

Vérifier qu'il s'agit bien de lui

C'est une précaution qui compte plus ici qu'ailleurs, parce que l'identifiant de Yandexbot est l'un des plus usurpés du web. De nombreux outils d'aspiration s'en réclament pour contourner les restrictions, en pariant sur le fait que personne ne vérifie.

La vérification suit la même méthode que pour les autres robots. On cherche le nom d'hôte associé à l'adresse du visiteur, on contrôle qu'il appartient bien aux domaines de Yandex, puis on résout ce nom pour confirmer qu'il renvoie à l'adresse de départ. Si l'une des deux étapes échoue, ce n'est pas Yandexbot.

Bloquer par l'identifiant seul ne sert donc pratiquement à rien, puisque celui qui usurpe cet identifiant peut en changer. Le blocage utile se fait sur l'adresse vérifiée, ou par un dispositif qui applique lui-même cette double résolution.

Reste à savoir si le blocage se justifie. Sur un site francophone qui ne vise aucun marché russophone, le trafic apporté par Yandex se compte souvent en dizaines de visites par mois, pour une charge de crawl parfois supérieure à celle de Bing. Le calcul se fait avec deux chiffres qu'on possède déjà, le nombre de sessions attribuées à ce moteur dans l'outil d'audience et le nombre de requêtes de son robot dans les journaux du serveur. Quand le second dépasse largement le premier et que l'hébergement souffre, la restriction se défend. Dans le cas contraire, laisser passer coûte moins cher que d'entretenir une règle de blocage qui finira par bloquer autre chose.

Ce que Yandex fait différemment

Trois particularités le distinguent, et les ignorer conduit à transposer des réflexes qui ne s'appliquent pas ici.

La directive de délai est respectée. Déjà évoquée, c'est la plus utile.

Le fichier robots.txt accepte une directive d'hôte principal. Yandex permet d'y déclarer la version canonique d'un domaine, ce qui n'a pas d'équivalent chez Google, où cela se règle par redirection et balise canonique.

Les outils pour webmasters sont distincts. Yandex propose son propre espace de suivi, avec des rapports d'exploration et d'indexation qui lui sont propres. Sur un site qui vise réellement ces marchés, s'y déclarer est le point de départ, exactement comme on le ferait avec la Search Console pour Google.

L'effet sur le budget d'exploration de Google

Une inquiétude revient régulièrement en rendez-vous : un robot tiers qui explore beaucoup consomme-t-il le budget que Google aurait consacré au site ? La réponse tient en deux temps, et elle est moins simple qu'un oui ou un non.

Techniquement, non. Google calcule sa propre cadence indépendamment des autres robots, et il n'existe aucun quota partagé entre Googlebot et Yandexbot.

Pratiquement, si, mais indirectement. Google ajuste sa cadence au temps de réponse du serveur, et il ralentit dès que celui-ci se dégrade pour ne pas aggraver la situation. Un robot tiers qui sature un hébergement modeste fait donc baisser la fréquence de passage de Googlebot, non pas en lui prenant un quota mais en dégradant les conditions dans lesquelles il travaille.

C'est ce mécanisme indirect qui justifie de s'occuper de la charge, et non une supposée compétition entre robots. Le sujet est développé sur ma page consacrée au budget de crawl.

Mon verdict

Sur les dizaines de sites francophones que j'audite, Yandexbot n'est jamais un sujet de référencement. Il apparaît dans les journaux, il consomme un peu, et la bonne décision se prend en deux minutes après avoir regardé deux chiffres : la part de trafic venue des zones concernées, et la part de requêtes qu'il représente sur le serveur.

La seule erreur que je vois régulièrement est le blocage réflexe de tous les robots qui ne sont pas Googlebot. Cette règle attrape Yandexbot, ce qui est sans conséquence, mais aussi Bingbot et les robots des moteurs génératifs, ce qui l'est beaucoup plus. Le sujet est traité sur mes pages consacrées à Bingbot et aux autres moteurs de recherche.

Questions fréquentes

Qu'est-ce que Yandexbot ?
Le robot d'exploration de Yandex, moteur de recherche dominant en Russie et bien implanté dans plusieurs pays voisins et en Turquie. Il fonctionne comme les autres robots : il découvre des adresses, récupère les pages et alimente un index.
Yandexbot a-t-il un intérêt pour un site français ?
Très rarement en termes de trafic. Yandex pèse peu dans les recherches francophones. Il devient pertinent dans deux cas seulement : une audience russophone réelle, ou une activité tournée vers les marchés où le moteur est utilisé. Ailleurs, la seule décision à prendre est celle de l'accueillir ou non, l'optimisation n'entrant pas en jeu.
Comment limiter la charge d'exploration de Yandexbot ?
Par la directive de délai entre requêtes dans le robots.txt, que Yandex prend en compte contrairement à Google. Une valeur de quelques secondes suffit à ramener la charge à un niveau négligeable sans couper l'accès. C'est la réponse proportionnée dans la majorité des cas.
Comment vérifier qu'une visite vient bien de Yandexbot ?
Par une double résolution de nom, comme pour les autres robots : on cherche le nom d'hôte associé à l'adresse, on vérifie qu'il appartient bien aux domaines de Yandex, puis on résout ce nom pour confirmer qu'il renvoie à l'adresse de départ. L'identifiant seul ne prouve rien, il est très souvent usurpé.
Faut-il bloquer Yandexbot ?
Cela dépend entièrement de votre audience. Sur un site sans aucun public dans les zones couvertes, le bloquer économise de la bande passante sans rien coûter. Sur un site qui a une audience internationale, même faible, le ralentir vaut mieux que le bloquer. Le blocage total se justifie surtout quand la charge devient réellement gênante.

Sources