Bag of Words en TF-IDF: hoe computers tekst omzetten in wiskunde
Dit artikel legt Bag of Words en TF-IDF uit, twee fundamentele methoden voor tekstrepresentatie. Het behandelt hoe ze wiskundig werken, hun historische oorsprong, en biedt een volledige implementatie in puur PHP voor documentzoekopdrachten.
Het artikel beschrijft hoe computers tekst omzetten in numerieke representaties, met de nadruk op Bag of Words (BoW) en TF-IDF. BoW representeert tekst als een vector van woordfrequenties, waarbij de woordvolgorde wordt genegeerd, terwijl TF-IDF woorden weegt op basis van hun frequentie binnen een document en zeldzaamheid over een corpus. De auteur plaatst dit in historische context en merkt op dat BoW zijn oorsprong vindt in de jaren vijftig en zestig, en dat TF-IDF is ontwikkeld door Karen Spärck Jones in 1972, later gepopulariseerd door Gerard Salton. Beperkingen zijn onder meer het negeren van woordvolgorde en semantiek. Het artikel bevat een stapsgewijze implementatie in pure PHP, die tokenisatie, berekening van termfrequentie, inverse documentfrequentie, TF-IDF-vectoren en cosinusovereenkomst voor het zoeken naar overeenkomsten tussen documenten demonstreert.
Bron: Хабр — Data Mining —
origineel
