बैग ऑफ वर्ड्स और टीएफ–आईडीएफ: कंप्यूटर कैसे पाठ को गणित में बदलते हैं
यह लेख बैग ऑफ वर्ड्स और टीएफ–आईडीएफ (टर्म फ्रीक्वेंसी–इन्वर्स डॉक्यूमेंट फ्रीक्वेंसी) की व्याख्या करता है, जो पाठ प्रतिनिधित्व की दो मौलिक विधियाँ हैं। इसमें बताया गया है कि वे गणितीय रूप से कैसे काम करती हैं, उनकी ऐतिहासिक उत्पत्ति क्या है, और दस्तावेज़ खोज के लिए शुद्ध PHP में एक पूर्ण कार्यान्वयन प्रदान करता है।
यह लेख बताता है कि कंप्यूटर पाठ को संख्यात्मक निरूपणों में कैसे परिवर्तित करते हैं, जिसमें बैग ऑफ वर्ड्स (BoW) और TF-IDF पर ध्यान केंद्रित किया गया है। BoW पाठ को शब्द गणनाओं के वेक्टर के रूप में दर्शाता है, जो शब्द क्रम को अनदेखा करता है, जबकि TF-IDF शब्दों को उनकी आवृत्ति के आधार पर दस्तावेज़ के भीतर और संपूर्ण कोष में दुर्लभता के अनुसार भारांकित करता है। लेखक ऐतिहासिक संदर्भ प्रदान करता है, यह नोट करते हुए कि BoW की उत्पत्ति 1950-60 के दशक में हुई थी और TF-IDF को करेन स्पार्क जोन्स द्वारा 1972 में विकसित किया गया था, जिसे बाद में जेरार्ड साल्टन ने लोकप्रिय बनाया। सीमाओं में शब्द क्रम और अर्थ विज्ञान की अनदेखी शामिल है। लेख में शुद्ध PHP में चरण-दर-चरण कार्यान्वयन शामिल है, जो टोकनीकरण, टर्म फ्रीक्वेंसी गणना, इनवर्स डॉक्यूमेंट फ्रीक्वेंसी, TF-IDF वेक्टर, और दस्तावेज़ समानता खोज के लिए कोसाइन समानता का प्रदर्शन करता है।
स्रोत: Хабр — Data Mining —
मूल
