ما الذي تتعلمه word2vec حقائقًا؟ الباحثون يطورون نظرية تعلم دقيقة لأول مرة
Berkeley Artificial Intelligence Research (BAIR)
طور باحثون من BAIR (Berkeley Artificial Intelligence Research) أول نظرية كمية وتنبؤية لعملية تعلم word2vec. يثبتون أنه في ظل ظروف واقعية، يتلخص التدريب في تحليل المصفوفة بطريقة المربعات الصغرى غير الموزونة، مع تمثيلات نهائية تُعطى بواسطة PCA لمصفوفة محددة مستمدة من إحصائيات النصوص.
في ورقة بحثية جديدة، يقدم باحثون من مجموعة باير (BAIR) أول نظرية تحليلية مغلقة لديناميكيات التعلم لنموذج word2vec. يظهرون أنه عندما تُهيأ التضمينات قرب الصفر، يتعلم النموذج المفاهيم واحدة تلو الأخرى، كل منها يقابل فضاءً جزئياً خطياً متعامداً، وتزداد الرتبة الفعالة لمصفوفة التضمين تدريجياً. السمات المُتعلمة هي المتجهات الذاتية العليا لمصفوفة M* المحددة باحتمالات التلازم. تتطابق النظرية جيداً مع التجارب العددية: يحقق word2vec 68% في معايير القياس، ويحصل النموذج التقريبي على 66%، مقابل 51% لطريقة المعلومات المتبادلة الإيجابية النقطية التقليدية (PPMI). يشرح العمل أيضاً ظهور التمثيلات الخطية للمفاهيم المجردة مثل الجنس أو الزمن.
المصدر: BAIR (Berkeley AI) —
الأصلي
