WDF*IDF - jak mierzymy trafność słów kluczowych
WDF*IDF to metoda statystyczna, którą wykorzystujemy, aby na podstawie danych branżowych ustalić, które słowa i w jakich proporcjach pojawiają się w najlepszych ofertach.
Czym jest WDF*IDF?
WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Razem mierzą, jak typowe jest dane słowo dla klastra dokumentów.
Innymi słowy: nie wygrywa "najczęstsze słowo" - lecz "słowo, które pojawia się nieproporcjonalnie często w topowych ofertach, a jest rzadkie w szerokiej puli".
Przykład
W biżuterii:
- "handmade" → wysokie IDF (rzadkie w ogólnej puli, częste w topowych
ofertach) → mocne słowo kluczowe
- "ring" → niskie IDF (w niemal każdej ofercie biżuterii) → słabe słowo kluczowe
- "925 sterling" → średnie IDF, wysokie w premium top-10 → mocne
słowo kluczowe różnicujące
Jak to wykorzystujemy
- Dla każdej branży budujemy *WDFIDF wektor** co tydzień z najlepszych 10%.
- Podczas optymalizacji porównujemy wektor Twojej oferty z wektorem branży.
- Podobieństwo kosinusowe daje nam
branch_titleibranch_desc. - Przy podobieństwie < 0.55 proponujemy top-5 brakujących słów kluczowych.
Ograniczenia
WDF*IDF nie rozumie znaczenia. "Ring" i "rings" to dwa słowa; synonimy nie są rozpoznawane. Dlatego na wierzchu działa warstwa embeddingów (oparta na BERT), budując klastry semantyczne.