E.A.S.Y. E.A.S.Y.
Metoda i proces · 5 min czytania

WDF*IDF - jak mierzymy trafność słów kluczowych

WDF*IDF to metoda statystyczna, którą wykorzystujemy, aby na podstawie danych branżowych ustalić, które słowa i w jakich proporcjach pojawiają się w najlepszych ofertach.

autor: robby

Czym jest WDF*IDF?

WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Razem mierzą, jak typowe jest dane słowo dla klastra dokumentów.

Innymi słowy: nie wygrywa "najczęstsze słowo" - lecz "słowo, które pojawia się nieproporcjonalnie często w topowych ofertach, a jest rzadkie w szerokiej puli".

Przykład

W biżuterii:

  • "handmade" → wysokie IDF (rzadkie w ogólnej puli, częste w topowych

ofertach) → mocne słowo kluczowe

  • "ring" → niskie IDF (w niemal każdej ofercie biżuterii) → słabe słowo kluczowe
  • "925 sterling" → średnie IDF, wysokie w premium top-10 → mocne

słowo kluczowe różnicujące

Jak to wykorzystujemy

  • Dla każdej branży budujemy *WDFIDF wektor** co tydzień z najlepszych 10%.
  • Podczas optymalizacji porównujemy wektor Twojej oferty z wektorem branży.
  • Podobieństwo kosinusowe daje nam branch_title i branch_desc.
  • Przy podobieństwie < 0.55 proponujemy top-5 brakujących słów kluczowych.

Ograniczenia

WDF*IDF nie rozumie znaczenia. "Ring" i "rings" to dwa słowa; synonimy nie są rozpoznawane. Dlatego na wierzchu działa warstwa embeddingów (oparta na BERT), budując klastry semantyczne.