الأبحاثالتطبيقات 🇷🇺 28.07.2026 23:03

حقيبة الكلمات وTF-IDF: كيف تحول الحواسيب النص إلى رياضيات

تشرح هذه المقالة مفهومي حقيبة الكلمات وتي إف-آي دي إف، وهما طريقتان أساسيتان لتمثيل النص. وتغطي كيفية عملهما رياضيًا، وأصولهما التاريخية، وتقدم تنفيذًا كاملاً بلغة PHP النقية للبحث في المستندات.
تشرح المقالة كيفية تحويل أجهزة الكمبيوتر للنصوص إلى تمثيلات رقمية، مع التركيز على حقيبة الكلمات (BoW) وTF-IDF. تمثل حقيبة الكلمات النص كمتجه لعدد مرات ظهور الكلمات، متجاهلةً ترتيب الكلمات، بينما يزن TF-IDF الكلمات حسب تكرارها داخل المستند وندرتها عبر المجموعة. يقدم المؤلف سياقًا تاريخيًا، مشيرًا إلى أن حقيبة الكلمات نشأت في خمسينيات وستينيات القرن الماضي، وأن TF-IDF طورته كارين سبيرك جونز في عام 1972، ثم شاعه جيرارد سالتون لاحقًا. تشمل القيود تجاهل ترتيب الكلمات والدلالات. تتضمن المقالة تنفيذًا خطوة بخطوة بلغة PHP الخالصة، موضحةً الترميز وحساب تكرار المصطلح وحساب معكوس تواتر المستندات ومتجهات TF-IDF وجيب تمام التشابه للبحث عن تشابه المستندات.
المصدر: Хабр — Data Mining — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة