WDF*IDF - comment nous mesurons la pertinence des mots-clés
WDF*IDF est la méthode statistique que nous utilisons pour déduire des données sectorielles quels mots apparaissent, et dans quelle proportion, dans les fiches produit les plus performantes.
Qu'est-ce que le WDF*IDF ?
WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Ensemble, ils mesurent à quel point un mot est typique d'un groupe de documents.
Autrement dit : ce n'est pas le « mot le plus fréquent » qui gagne - mais le « mot qui apparaît de façon disproportionnée dans les meilleures fiches tout en restant rare dans l'ensemble large ».
Exemple
Dans la bijouterie :
- « handmade » → IDF élevé (rare dans l'ensemble général, fréquent dans les meilleures
fiches) → mot-clé fort
- « ring » → IDF faible (dans presque chaque fiche de bijoux) → mot-clé faible
- « 925 sterling » → IDF moyen, élevé dans le top-10 premium → puissant
mot-clé de différenciation
Comment nous l'utilisons
- Pour chaque secteur, nous construisons un *WDFIDF vecteur** chaque semaine à partir du top-10 %.
- Lors de l'optimisation, nous comparons le vecteur de votre fiche au vecteur du secteur.
- La similarité cosinus nous donne
branch_titleetbranch_desc. - À une similarité < 0.55, nous suggérons le top-5 des mots-clés manquants.
Limites
WDF*IDF n'a aucune compréhension sémantique. « Ring » et « rings » sont deux mots ; les synonymes ne sont pas résolus. C'est pourquoi une couche d'embedding (basée sur BERT) s'ajoute par-dessus, construisant des clusters sémantiques.