E.A.S.Y. E.A.S.Y.
Metodo & Workflow · 5 min di lettura

WDF*IDF - come misuriamo la pertinenza delle parole chiave

WDF*IDF è il metodo statistico che usiamo per ricavare dai dati di settore quali parole compaiono e in quale proporzione nelle schede prodotto più performanti.

di robby

Che cos'è il WDF*IDF?

WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Insieme misurano quanto sia tipica una parola per un cluster di documenti.

Significa: non vince la "parola più frequente" - ma la "parola che compare in modo sproporzionato nelle migliori schede prodotto pur essendo rara nel pool ampio".

Esempio

Nella gioielleria:

  • "handmade" → IDF alto (raro nel pool generale, frequente nelle migliori

schede prodotto) → parola chiave forte

  • "ring" → IDF basso (in quasi ogni scheda prodotto di gioielli) → parola chiave debole
  • "925 sterling" → IDF medio, alto nella top-10 premium → forte

parola chiave di differenziazione

Come lo usiamo

  • Per ogni settore costruiamo un vettore *WDFIDF** ogni settimana dal top-10%.
  • Durante l'ottimizzazione confrontiamo il vettore della tua scheda prodotto con il vettore del settore.
  • La similarità del coseno ci dà branch_title e branch_desc.
  • Con una similarità < 0.55 suggeriamo le top-5 parole chiave mancanti.

Limiti

WDF*IDF non ha comprensione semantica. "Ring" e "rings" sono due parole; i sinonimi non vengono risolti. Per questo uno strato di embedding (basato su BERT) opera al di sopra, costruendo cluster semantici.