AraştırmaUygulamalar 🇷🇺 28.07.2026 23:03

Bag of Words ve TF–IDF: Bilgisayarlar Metni Nasıl Matematiğe Dönüştürür

Bu makale, iki temel metin temsil yöntemi olan Bag of Words ve TF–IDF'yi açıklar. Matematiksel olarak nasıl çalıştıklarını, tarihsel kökenlerini ve belge arama için saf PHP ile eksiksiz bir uygulamayı kapsar.
Makale, bilgisayarların metni sayısal temsillere nasıl dönüştürdüğünü açıklıyor ve Bag of Words (BoW) ile TF-IDF üzerine odaklanıyor. BoW, metni kelime sırasını göz ardı ederek bir kelime sayıları vektörü olarak temsil ederken, TF-IDF kelimeleri bir belge içindeki sıklıklarına ve bir derlem içindeki nadirliklerine göre ağırlıklandırır. Yazar, BoW'un 1950'ler-60'larda ortaya çıktığını ve TF-IDF'nin 1972'de Karen Spärck Jones tarafından geliştirildiğini, daha sonra Gerard Salton tarafından popülerleştirildiğini belirterek tarihsel bir bağlam sağlıyor. Sınırlamalar arasında kelime sırasının ve anlamın göz ardı edilmesi yer alıyor. Makale, saf PHP ile adım adım bir uygulamayı içeriyor; tokenizasyon, terim sıklığı hesaplama, ters belge sıklığı, TF-IDF vektörleri ve belge benzerlik araması için kosinüs benzerliğini gösteriyor.
Kaynak: Хабр — Data Mining — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler