E.A.S.Y. E.A.S.Y.
Méthode & Workflow · 5 min de lecture

WDF*IDF - comment nous mesurons la pertinence des mots-clés

WDF*IDF est la méthode statistique que nous utilisons pour déduire des données sectorielles quels mots apparaissent, et dans quelle proportion, dans les fiches produit les plus performantes.

par robby

Qu'est-ce que le WDF*IDF ?

WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Ensemble, ils mesurent à quel point un mot est typique d'un groupe de documents.

Autrement dit : ce n'est pas le « mot le plus fréquent » qui gagne - mais le « mot qui apparaît de façon disproportionnée dans les meilleures fiches tout en restant rare dans l'ensemble large ».

Exemple

Dans la bijouterie :

  • « handmade » → IDF élevé (rare dans l'ensemble général, fréquent dans les meilleures

fiches) → mot-clé fort

  • « ring » → IDF faible (dans presque chaque fiche de bijoux) → mot-clé faible
  • « 925 sterling » → IDF moyen, élevé dans le top-10 premium → puissant

mot-clé de différenciation

Comment nous l'utilisons

  • Pour chaque secteur, nous construisons un *WDFIDF vecteur** chaque semaine à partir du top-10 %.
  • Lors de l'optimisation, nous comparons le vecteur de votre fiche au vecteur du secteur.
  • La similarité cosinus nous donne branch_title et branch_desc.
  • À une similarité < 0.55, nous suggérons le top-5 des mots-clés manquants.

Limites

WDF*IDF n'a aucune compréhension sémantique. « Ring » et « rings » sont deux mots ; les synonymes ne sont pas résolus. C'est pourquoi une couche d'embedding (basée sur BERT) s'ajoute par-dessus, construisant des clusters sémantiques.