Bag of Words und TF–IDF: Wie Computer Text in Mathematik verwandeln
Dieser Artikel erklärt Bag of Words und TF–IDF, zwei grundlegende Methoden zur Textrepräsentation. Er behandelt, wie sie mathematisch funktionieren, ihre historischen Ursprünge und bietet eine vollständige Implementierung in reinem PHP für die Dokumentsuche.
Der Artikel beschreibt, wie Computer Texte in numerische Darstellungen umwandeln, wobei der Schwerpunkt auf Bag of Words (BoW) und TF-IDF liegt. BoW repräsentiert Text als einen Vektor von Wortzählungen und ignoriert die Wortreihenfolge, während TF-IDF Wörter nach ihrer Häufigkeit innerhalb eines Dokuments und ihrer Seltenheit im gesamten Korpus gewichtet. Die Autorin bzw. der Autor bietet einen historischen Kontext und weist darauf hin, dass BoW in den 1950er- und 1960er-Jahren entstand und TF-IDF von Karen Spärck Jones im Jahr 1972 entwickelt und später von Gerard Salton populär gemacht wurde. Zu den Einschränkungen gehören das Ignorieren von Wortreihenfolge und Semantik. Der Artikel enthält eine Schritt-für-Schritt-Implementierung in reinem PHP, die Tokenisierung, Berechnung der Termhäufigkeit, inverse Dokumenthäufigkeit, TF-IDF-Vektoren und Kosinusähnlichkeit für die Ähnlichkeitssuche von Dokumenten demonstriert.
Quelle: Хабр — Data Mining —
Original
