WDF*IDF - come misuriamo la pertinenza delle parole chiave
WDF*IDF è il metodo statistico che usiamo per ricavare dai dati di settore quali parole compaiono e in quale proporzione nelle schede prodotto più performanti.
Che cos'è il WDF*IDF?
WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Insieme misurano quanto sia tipica una parola per un cluster di documenti.
Significa: non vince la "parola più frequente" - ma la "parola che compare in modo sproporzionato nelle migliori schede prodotto pur essendo rara nel pool ampio".
Esempio
Nella gioielleria:
- "handmade" → IDF alto (raro nel pool generale, frequente nelle migliori
schede prodotto) → parola chiave forte
- "ring" → IDF basso (in quasi ogni scheda prodotto di gioielli) → parola chiave debole
- "925 sterling" → IDF medio, alto nella top-10 premium → forte
parola chiave di differenziazione
Come lo usiamo
- Per ogni settore costruiamo un vettore *WDFIDF** ogni settimana dal top-10%.
- Durante l'ottimizzazione confrontiamo il vettore della tua scheda prodotto con il vettore del settore.
- La similarità del coseno ci dà
branch_titleebranch_desc. - Con una similarità < 0.55 suggeriamo le top-5 parole chiave mancanti.
Limiti
WDF*IDF non ha comprensione semantica. "Ring" e "rings" sono due parole; i sinonimi non vengono risolti. Per questo uno strato di embedding (basato su BERT) opera al di sopra, costruendo cluster semantici.