Sanapussi ja TF–IDF: miten tietokoneet muuttavat tekstin matematiikaksi
Tässä artikkelissa selitetään sanapussi ja TF–IDF, kaksi perustavanlaatuista tekstin esitystapaa. Artikkeli käsittelee niiden matemaattista toimintaa, historiallista taustaa ja tarjoaa täydellisen toteutuksen puhtaalla PHP:llä dokumenttihakua varten.
Artikkelissa kuvataan, kuinka tietokoneet muuntavat tekstiä numeerisiksi esityksiksi, keskittyen Bag of Words (BoW) -menetelmään ja TF-IDF:ään. BoW esittää tekstin vektorina sanojen esiintymismääristä jättäen sanajärjestyksen huomiotta, kun taas TF-IDF painottaa sanoja niiden esiintymistiheyden perusteella dokumentissa ja harvinaisuuden perusteella koko korpuksessa. Kirjoittaja antaa historiallisen taustan, huomauttaen, että BoW sai alkunsa 1950- ja 1960-luvuilla ja että TF-IDF:n kehitti Karen Spärck Jones vuonna 1972, ja myöhemmin sen teki tunnetuksi Gerard Salton. Rajoitteisiin kuuluu sanajärjestyksen ja merkitysten huomiotta jättäminen. Artikkeli sisältää vaiheittaisen toteutuksen puhtaalla PHP:llä, joka havainnollistaa tokenisaatiota, termien esiintymistiheyden laskentaa, käänteistä dokumenttitiheyttä, TF-IDF-vektoreita ja kosinisimilariteettia dokumenttien samankaltaisuuden hakua varten.
Lähde: Хабр — Data Mining —
Alkuperäinen
