Une mesure, pas une consigne de rédaction
TF-IDF croise la fréquence d'un mot dans votre page et sa rareté dans l'ensemble des pages. C'est une mesure de recherche d'information, pas une consigne de rédaction. Les outils qui s'en réclament servent surtout à repérer les sujets que vos concurrents traitent et que vous ne traitez pas. Utilisés comme une cible d'occurrences à atteindre, ils produisent du texte forcé et ne font rien gagner.
Ce que la formule calcule
Elle multiplie deux termes. Un mot compte s'il est fréquent chez vous et rare ailleurs.
- TF, pour term frequency : la fréquence du mot dans le document. Si « toiture » apparaît vingt fois dans votre page, ce terme est élevé.
- IDF, pour inverse document frequency : l'inverse de la fréquence du mot dans le corpus, généralement sous forme logarithmique. Un mot présent dans tous les documents, comme « le » ou « site », obtient une valeur proche de zéro ; un mot présent dans peu de documents obtient une valeur élevée.
La partie IDF est l'apport de Karen Spärck Jones, dans un article publié en 1972 au Journal of Documentation, qui proposait de pondérer les termes par leur spécificité statistique. C'est l'une des idées les plus durables de la recherche d'information, et elle reste au cœur de moteurs de recherche internes et de bases documentaires aujourd'hui.
La confusion à ne pas faire. TF-IDF est une mesure de caractérisation d'un document, qui dit quels mots le distinguent des autres. Ce n'est pas une mesure de qualité ni de pertinence pour une requête. Un texte incohérent bourré de termes rares obtient d'excellents scores TF-IDF. C'est précisément pour cette raison que les moteurs ont cessé de s'appuyer dessus seuls, dès la fin des années 1990.
Ce que Google en dit, et ce qu'il utilise
Interrogé sur l'intérêt d'optimiser un contenu selon le TF-IDF, John Mueller a répondu que c'est une métrique assez ancienne et que les choses ont beaucoup évolué au fil des années, en ajoutant que pour comprendre quels mots sont pertinents sur une page, Google emploie une grande variété de techniques issues de la recherche d'information.
Cette réponse est plus intéressante qu'un simple démenti. Elle ne dit pas que la statistique lexicale ne sert à rien, elle dit qu'elle n'est qu'un ingrédient parmi beaucoup, et qu'optimiser sur cet ingrédient isolé n'a pas de sens.
| Époque | Ce qui classe | Ce qu'il fallait écrire |
|---|---|---|
| Années 1990 | Comptage de mots, densité | Répéter le mot-clé. D'où le bourrage de mots-clés |
| Années 2000 | Statistique lexicale plus fine, et surtout les liens | Le vocabulaire compte, la popularité davantage |
| Années 2010 | Entités, graphe de connaissances, apprentissage automatique appliqué au classement | Traiter un sujet, pas placer un terme |
| Depuis 2019 | Modèles de langue, dont BERT déployé sur la recherche en octobre 2019 puis étendu à plus de soixante-dix langues, dont le français, en décembre 2019 | Le sens de la phrase est interprété, y compris les prépositions et l'ordre des mots |
L'arrivée de BERT change la nature du problème. Un modèle qui interprète « pour » et « sans » dans une requête ne se satisfait pas d'un comptage de termes. Écrire pour un score de fréquence revient à optimiser pour un moteur qui n'existe plus.
Des pages qui répondent vraiment à ce que cherchent vos clients
Je repère les pages à écrire et celles à reprendre à partir des requêtes réelles, je les produis ou je les fais produire, puis je mesure ce qui progresse. C'est le cœur de mes accompagnements mensuels. Comptez de 300 à 1 500 € par mois selon le périmètre.
Je regarde votre site avant de répondre. Réponse sous 24 h en semaine.
Ce qui l'a remplacé, et qui tourne peut-être chez vous
La suite de l'histoire est plus intéressante que son abandon, et elle a une conséquence pratique pour beaucoup de sites.
En novembre 1994, à la troisième conférence TREC, Stephen Robertson et Karen Spärck Jones, la même qui avait proposé l'IDF vingt-deux ans plus tôt, présentent BM25. Le nom vient du vingt-cinquième modèle d'une série d'expériences, les précédents ayant moins bien fonctionné. La formule corrige deux défauts du TF-IDF que n'importe quel rédacteur a constatés sans les nommer.
- La saturation de la fréquence. Dans le TF-IDF, répéter un mot cinquante fois vaut cinquante fois une occurrence. Dans BM25, la contribution d'un terme plafonne, et la dixième répétition n'apporte presque plus rien. C'est la traduction mathématique de ce que Google dit du bourrage de mots-clés.
- La normalisation par la longueur. Un document long contient mécaniquement plus d'occurrences de tout. BM25 en tient compte, de sorte qu'une page de cinq mille mots ne prend pas l'avantage sur une page de mille mots par le seul effet de sa taille.
Et voilà le point qui intéresse un site. BM25 est le mode de classement par défaut de Lucene et d'Elasticsearch, depuis leurs versions de 2016. Autrement dit, si votre site, votre boutique ou votre intranet dispose d'un moteur de recherche interne, il y a de bonnes chances que ce soit exactement cette formule qui décide de l'ordre des résultats que voient vos visiteurs. Le S de SEO désigne la recherche, pas Google. Ce moteur interne est souvent le plus rentable du site et le plus négligé, et il se règle avec les notions de cette page. Voir le référencement naturel.
Ce que cela change pour votre recherche interne : les paramètres de BM25 se règlent, et les valeurs par défaut ne conviennent pas à tous les catalogues. Sur un site où les fiches produits sont très courtes, la normalisation par la longueur pénalise à tort les descriptions détaillées ; sur une base documentaire, c'est l'inverse. Un moteur interne qui ne remonte jamais la bonne fiche n'a pas besoin de plus de contenu, il a besoin qu'on regarde ses réglages.
Ce que font réellement les outils qui s'en réclament
Les outils français et internationaux qui proposent une « optimisation sémantique » ne calculent d'ailleurs pas un TF-IDF au sens strict. Ils font quelque chose de plus intéressant et de plus simple à comprendre.
- 1. Ils récupèrent les pages classées
Les dix ou vingt premiers résultats sur la requête cible, à l'instant où vous lancez l'analyse.
- 2. Ils extraient le vocabulaire commun
Les termes et expressions qui reviennent chez la plupart d'entre elles, pondérés d'une manière ou d'une autre.
- 3. Ils comparent à votre texte
Et produisent une liste de ce qui est présent chez les autres et absent chez vous, souvent assortie d'un score.
Le résultat est utile, et le score ne l'est pas. La liste de termes manquants est en réalité une liste de sujets non traités : si toutes les pages classées parlent de garantie décennale et que la vôtre n'en parle pas, vous avez un chapitre absent, pas un problème de fréquence lexicale. Le score, lui, encourage à placer les mots plutôt qu'à écrire la section, ce qui est exactement le mauvais mouvement.
Comment je lis un rapport de ce type
Je supprime le score de mon écran, mentalement, et je ne garde que la liste. Pour chaque terme absent, une seule question : est-ce que cela correspond à quelque chose que je devrais traiter et que je ne traite pas ? Si oui, cela devient un intertitre ou un paragraphe, écrit normalement. Si non, cela ne devient rien, quel que soit son poids affiché. Sur un rapport de quatre-vingts termes, il en reste en général une dizaine qui méritent une section, et c'est ce qui fait progresser la page. Les soixante-dix autres sont du bruit de corpus.
La densité de mots-clés, pour solde de tout compte
Question voisine, qui revient à chaque fois : quelle densité viser ? Aucune. Google a répété qu'il n'existe pas de pourcentage magique, et il n'y a aucune raison mécanique qu'il en existe un, puisque la longueur du document, la variété du vocabulaire et le sujet font varier le chiffre naturellement.
Ce qui reste vrai en revanche, et qui n'est pas une question de densité :
- Le sujet doit être identifiable dès le titre, l'introduction et les intertitres. Une page qui parle de toiture sans jamais employer le mot pose un problème réel, qui n'est pas statistique.
- Le vocabulaire doit être celui du lecteur, pas celui de l'entreprise. C'est l'écart le plus fréquent, et il se repère avec l'autocomplétion mieux qu'avec n'importe quel outil.
- La répétition forcée se voit. C'est le test de lecture à voix haute : si une phrase sonne faux, elle a été écrite pour un compteur. Voir le bourrage de mots-clés.
Ce que je fais à la place
Lire réellement les trois premiers résultats sur la requête visée, et noter au fil de la lecture ce qu'ils traitent que vous ne traitez pas. La méthode ne coûte qu'un peu de temps et remonte davantage que n'importe quel rapport.
Ce que cette lecture remonte et qu'aucun outil ne remonte : une question à laquelle tout le monde répond et pas vous, un tableau comparatif que tout le monde propose, une objection que tout le monde lève, un format que tout le monde a adopté. Ce sont des différences de structure et d'intention, pas de vocabulaire, et ce sont elles qui décident du classement. Voir l'intention de recherche et la rédaction de contenu SEO.
Questions fréquentes
Sources
- Spärck Jones, K., « A statistical interpretation of term specificity and its application in retrieval », Journal of Documentation, 1972 : origine de la pondération par la rareté des termes.
- Google, « Understanding searches better than ever before », octobre 2019 : déploiement de BERT dans la recherche, étendu à plus de soixante-dix langues en décembre 2019.
- Robertson, S. et Spärck Jones, K., présentation de BM25 à la troisième conférence TREC, Gaithersburg, novembre 1994 : saturation de la fréquence et normalisation par la longueur du document.
- Apache Lucene,
BM25Similarity: BM25 comme fonction de similarité par défaut de Lucene, et donc d'Elasticsearch. - Position de John Mueller sur le TF-IDF, exprimée publiquement lors d'une session de questions-réponses de Google Search Central : métrique ancienne, techniques de recherche d'information multiples.