Une mesure, pas une consigne de rédaction

TF-IDF croise la fréquence d'un mot dans votre page et sa rareté dans l'ensemble des pages. C'est une mesure de recherche d'information, pas une consigne de rédaction. Les outils qui s'en réclament servent surtout à repérer les sujets que vos concurrents traitent et que vous ne traitez pas. Utilisés comme une cible d'occurrences à atteindre, ils produisent du texte forcé et ne font rien gagner.

Ce que la formule calcule

TF-IDF, la fréquence d'un terme dans un document rapportée à sa rareté dans l'ensemble du corpus

Elle multiplie deux termes. Un mot compte s'il est fréquent chez vous et rare ailleurs.

La partie IDF est l'apport de Karen Spärck Jones, dans un article publié en 1972 au Journal of Documentation, qui proposait de pondérer les termes par leur spécificité statistique. C'est l'une des idées les plus durables de la recherche d'information, et elle reste au cœur de moteurs de recherche internes et de bases documentaires aujourd'hui.

La confusion à ne pas faire. TF-IDF est une mesure de caractérisation d'un document, qui dit quels mots le distinguent des autres. Ce n'est pas une mesure de qualité ni de pertinence pour une requête. Un texte incohérent bourré de termes rares obtient d'excellents scores TF-IDF. C'est précisément pour cette raison que les moteurs ont cessé de s'appuyer dessus seuls, dès la fin des années 1990.

Ce que Google en dit, et ce qu'il utilise

Interrogé sur l'intérêt d'optimiser un contenu selon le TF-IDF, John Mueller a répondu que c'est une métrique assez ancienne et que les choses ont beaucoup évolué au fil des années, en ajoutant que pour comprendre quels mots sont pertinents sur une page, Google emploie une grande variété de techniques issues de la recherche d'information.

Cette réponse est plus intéressante qu'un simple démenti. Elle ne dit pas que la statistique lexicale ne sert à rien, elle dit qu'elle n'est qu'un ingrédient parmi beaucoup, et qu'optimiser sur cet ingrédient isolé n'a pas de sens.

ÉpoqueCe qui classeCe qu'il fallait écrire
Années 1990Comptage de mots, densitéRépéter le mot-clé. D'où le bourrage de mots-clés
Années 2000Statistique lexicale plus fine, et surtout les liensLe vocabulaire compte, la popularité davantage
Années 2010Entités, graphe de connaissances, apprentissage automatique appliqué au classementTraiter un sujet, pas placer un terme
Depuis 2019Modèles de langue, dont BERT déployé sur la recherche en octobre 2019 puis étendu à plus de soixante-dix langues, dont le français, en décembre 2019Le sens de la phrase est interprété, y compris les prépositions et l'ordre des mots

L'arrivée de BERT change la nature du problème. Un modèle qui interprète « pour » et « sans » dans une requête ne se satisfait pas d'un comptage de termes. Écrire pour un score de fréquence revient à optimiser pour un moteur qui n'existe plus.

Contenu et sémantique

Des pages qui répondent vraiment à ce que cherchent vos clients

Je repère les pages à écrire et celles à reprendre à partir des requêtes réelles, je les produis ou je les fais produire, puis je mesure ce qui progresse. C'est le cœur de mes accompagnements mensuels. Comptez de 300 à 1 500 € par mois selon le périmètre.

Je regarde votre site avant de répondre. Réponse sous 24 h en semaine.

Ce qui l'a remplacé, et qui tourne peut-être chez vous

La suite de l'histoire est plus intéressante que son abandon, et elle a une conséquence pratique pour beaucoup de sites.

En novembre 1994, à la troisième conférence TREC, Stephen Robertson et Karen Spärck Jones, la même qui avait proposé l'IDF vingt-deux ans plus tôt, présentent BM25. Le nom vient du vingt-cinquième modèle d'une série d'expériences, les précédents ayant moins bien fonctionné. La formule corrige deux défauts du TF-IDF que n'importe quel rédacteur a constatés sans les nommer.

Et voilà le point qui intéresse un site. BM25 est le mode de classement par défaut de Lucene et d'Elasticsearch, depuis leurs versions de 2016. Autrement dit, si votre site, votre boutique ou votre intranet dispose d'un moteur de recherche interne, il y a de bonnes chances que ce soit exactement cette formule qui décide de l'ordre des résultats que voient vos visiteurs. Le S de SEO désigne la recherche, pas Google. Ce moteur interne est souvent le plus rentable du site et le plus négligé, et il se règle avec les notions de cette page. Voir le référencement naturel.

Ce que cela change pour votre recherche interne : les paramètres de BM25 se règlent, et les valeurs par défaut ne conviennent pas à tous les catalogues. Sur un site où les fiches produits sont très courtes, la normalisation par la longueur pénalise à tort les descriptions détaillées ; sur une base documentaire, c'est l'inverse. Un moteur interne qui ne remonte jamais la bonne fiche n'a pas besoin de plus de contenu, il a besoin qu'on regarde ses réglages.

Ce que font réellement les outils qui s'en réclament

Les outils français et internationaux qui proposent une « optimisation sémantique » ne calculent d'ailleurs pas un TF-IDF au sens strict. Ils font quelque chose de plus intéressant et de plus simple à comprendre.

  1. 1. Ils récupèrent les pages classées

    Les dix ou vingt premiers résultats sur la requête cible, à l'instant où vous lancez l'analyse.

  2. 2. Ils extraient le vocabulaire commun

    Les termes et expressions qui reviennent chez la plupart d'entre elles, pondérés d'une manière ou d'une autre.

  3. 3. Ils comparent à votre texte

    Et produisent une liste de ce qui est présent chez les autres et absent chez vous, souvent assortie d'un score.

Le résultat est utile, et le score ne l'est pas. La liste de termes manquants est en réalité une liste de sujets non traités : si toutes les pages classées parlent de garantie décennale et que la vôtre n'en parle pas, vous avez un chapitre absent, pas un problème de fréquence lexicale. Le score, lui, encourage à placer les mots plutôt qu'à écrire la section, ce qui est exactement le mauvais mouvement.

Comment je lis un rapport de ce type

Je supprime le score de mon écran, mentalement, et je ne garde que la liste. Pour chaque terme absent, une seule question : est-ce que cela correspond à quelque chose que je devrais traiter et que je ne traite pas ? Si oui, cela devient un intertitre ou un paragraphe, écrit normalement. Si non, cela ne devient rien, quel que soit son poids affiché. Sur un rapport de quatre-vingts termes, il en reste en général une dizaine qui méritent une section, et c'est ce qui fait progresser la page. Les soixante-dix autres sont du bruit de corpus.

La densité de mots-clés, pour solde de tout compte

Question voisine, qui revient à chaque fois : quelle densité viser ? Aucune. Google a répété qu'il n'existe pas de pourcentage magique, et il n'y a aucune raison mécanique qu'il en existe un, puisque la longueur du document, la variété du vocabulaire et le sujet font varier le chiffre naturellement.

Ce qui reste vrai en revanche, et qui n'est pas une question de densité :

Ce que je fais à la place

Lire réellement les trois premiers résultats sur la requête visée, et noter au fil de la lecture ce qu'ils traitent que vous ne traitez pas. La méthode ne coûte qu'un peu de temps et remonte davantage que n'importe quel rapport.

Ce que cette lecture remonte et qu'aucun outil ne remonte : une question à laquelle tout le monde répond et pas vous, un tableau comparatif que tout le monde propose, une objection que tout le monde lève, un format que tout le monde a adopté. Ce sont des différences de structure et d'intention, pas de vocabulaire, et ce sont elles qui décident du classement. Voir l'intention de recherche et la rédaction de contenu SEO.

Questions fréquentes

Qu'est-ce que le TF-IDF, simplement ?
Une formule qui donne du poids à un mot dans un document en croisant deux choses : sa fréquence dans ce document, et sa rareté dans l'ensemble des documents. Un mot très présent chez vous et rare ailleurs obtient un score élevé, ce qui signale qu'il est caractéristique de votre texte. La partie rareté vient des travaux de Karen Spärck Jones publiés en 1972.
Google utilise-t-il le TF-IDF pour classer les pages ?
Pas comme levier d'optimisation, en tout cas. John Mueller a répondu sur ce point que c'est une métrique assez ancienne et que les choses ont beaucoup évolué, en précisant que Google emploie une grande variété de techniques de recherche d'information. Depuis 2019 et le déploiement de BERT, la compréhension des requêtes et des pages repose sur des modèles de langue qui n'ont plus grand-chose à voir avec un comptage de mots.
À quoi servent alors les outils d'analyse sémantique ?
À repérer ce qui manque, pas à atteindre un score. Ces outils comparent votre page aux pages déjà classées sur la requête et listent les termes présents chez elles et absents chez vous. Lu comme une liste de sujets non traités, c'est utile et cela fait gagner du temps. Lu comme une consigne d'occurrences à placer, cela produit exactement le texte artificiel que ces outils prétendent éviter.
Y a-t-il une densité de mots-clés idéale ?
Non, et Google l'a répété à de nombreuses reprises : il n'existe pas de pourcentage magique. La densité de mots-clés est un héritage des moteurs des années 1990, à une époque où le comptage brut suffisait à classer. Viser une valeur cible aujourd'hui n'apporte rien et conduit à des tournures forcées que la lecture à voix haute repère immédiatement.
Que faut-il faire à la place ?
Lire les trois premiers résultats sur la requête visée, et lister ce qu'ils traitent que vous ne traitez pas. C'est plus long qu'un rapport d'outil, et cela remonte les vraies lacunes : une question à laquelle tout le monde répond sauf vous, un tableau comparatif que tout le monde propose, une objection que tout le monde lève. Aucun score ne remplace cette lecture.

Sources