Sac de mots et TF–IDF : comment les ordinateurs transforment le texte en mathématiques
Cet article explique le sac de mots et le TF–IDF, deux méthodes fondamentales de représentation textuelle. Il aborde leur fonctionnement mathématique, leurs origines historiques, et fournit une implémentation complète en PHP pur pour la recherche documentaire.
L'article décrit comment les ordinateurs convertissent le texte en représentations numériques, en se concentrant sur le sac de mots (BoW) et TF-IDF. Le sac de mots représente le texte comme un vecteur de fréquences de mots, en ignorant l'ordre des mots, tandis que TF-IDF pondère les mots en fonction de leur fréquence dans un document et de leur rareté dans un corpus. L'auteur fournit un contexte historique, notant que le sac de mots est apparu dans les années 1950-1960 et que TF-IDF a été développé par Karen Spärck Jones en 1972, puis popularisé par Gerard Salton. Les limites incluent l'ignorance de l'ordre des mots et de la sémantique. L'article comprend une implémentation pas à pas en PHP pur, démontrant la tokenisation, le calcul de la fréquence des termes, la fréquence inverse de document, les vecteurs TF-IDF et la similarité cosinus pour la recherche de similarité entre documents.
Source: Хабр — Data Mining —
original
