E.A.S.Y. E.A.S.Y.
Método y flujo de trabajo · 5 min de lectura

WDF*IDF - cómo medimos la relevancia de las palabras clave

WDF*IDF es el método estadístico que usamos para deducir, a partir de los datos del sector, qué palabras aparecen y en qué proporción en las fichas de producto de mejor rendimiento.

por robby

¿Qué es WDF*IDF?

WDF = Within-Document Frequency. IDF = Inverse Document Frequency. Juntas miden cómo de típica es una palabra para un grupo de documentos.

Es decir: no gana la «palabra más frecuente» - sino la «palabra que aparece de forma desproporcionada en las mejores fichas de producto pero es rara en el conjunto amplio».

Ejemplo

En joyería:

  • «handmade» → IDF alto (raro en el conjunto general, frecuente en las mejores

fichas) → palabra clave fuerte

  • «ring» → IDF bajo (en casi todas las fichas de joyería) → palabra clave débil
  • «925 sterling» → IDF medio, alto en el top-10 premium → fuerte

palabra clave diferenciadora

Cómo lo usamos

  • Por cada sector construimos un *WDFIDF vector** cada semana a partir del top-10%.
  • Al optimizar, comparamos el vector de tu ficha de producto con el vector del sector.
  • La similitud del coseno nos da branch_title y branch_desc.
  • Con una similitud < 0.55 sugerimos las top-5 palabras clave que faltan.

Límites

WDF*IDF no tiene comprensión semántica. «Ring» y «rings» son dos palabras; los sinónimos no se resuelven. Por eso una capa de embeddings (basada en BERT) actúa por encima, construyendo clusters semánticos.