WDF*IDF - cómo medimos la relevancia de las palabras clave
WDF*IDF es el método estadístico que usamos para deducir, a partir de los datos del sector, qué palabras aparecen y en qué proporción en las fichas de producto de mejor rendimiento.
¿Qué es WDF*IDF?
WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Juntas miden cómo de típica es una palabra para un grupo de documentos.
Es decir: no gana la «palabra más frecuente» - sino la «palabra que aparece de forma desproporcionada en las mejores fichas de producto pero es rara en el conjunto amplio».
Ejemplo
En joyería:
- «handmade» → IDF alto (raro en el conjunto general, frecuente en las mejores
fichas) → palabra clave fuerte
- «ring» → IDF bajo (en casi todas las fichas de joyería) → palabra clave débil
- «925 sterling» → IDF medio, alto en el top-10 premium → fuerte
palabra clave diferenciadora
Cómo lo usamos
- Por cada sector construimos un *WDFIDF vector** cada semana a partir del top-10%.
- Al optimizar, comparamos el vector de tu ficha de producto con el vector del sector.
- La similitud del coseno nos da
branch_titleybranch_desc. - Con una similitud < 0.55 sugerimos las top-5 palabras clave que faltan.
Límites
WDF*IDF no tiene comprensión semántica. «Ring» y «rings» son dos palabras; los sinónimos no se resuelven. Por eso una capa de embeddings (basada en BERT) actúa por encima, construyendo clusters semánticos.