باحثون من أدوبي وستانفورد وبرينستون يقترحون نماذج عالم فيديو بذاكرة طويلة المدى تعتمد على نماذج الحالة-الفضاء
Princeton University (Sengupta Lab)
طوّر باحثون من جامعة ستانفورد وجامعة برينستون وأدوبي ريسيرش بنية نموذج عالم فيديو جديدة تُسمى LSSVWM تستخدم نماذج الحالة-الفضاء (State-Space Models) لتوسيع الذاكرة الزمنية بكفاءة. يعالج النموذج التكلفة الحسابية التربيعية لآليات الانتباه عن طريق مسح SSM على شكل كتلة وانتباه محلي كثيف، مما يتيح ذاكرة طويلة المدى لمهام مثل الاسترجاع المكاني والاستدلال في بيئات ماينكرافت ومتاهة الذاكرة.
ورقة بحثية جديدة بعنوان "نماذج عالم الفيديو المعتمدة على فضاء الحالة ذات السياق الطويل"، أعدها باحثون من جامعة ستانفورد وجامعة برينستون وAdobe Research، تقترح حلاً لاختناق الذاكرة طويلة المدى في نماذج عالم الفيديو. المشكلة الأساسية هي أن طبقات الانتباه التقليدية تمتلك تعقيدًا حسابيًا تربيعيًا بالنسبة لطول التسلسل، مما يجعل الذاكرة طويلة المدى غير عملية. يقدم المؤلفون نموذج عالم الفيديو المعتمد على فضاء الحالة ذو السياق الطويل (LSSVWM)، الذي يستفيد من نماذج فضاء الحالة (SSMs) للنمذجة السببية الفعالة للتسلسلات. تشمل الخيارات التصميمية الرئيسية مخطط مسح كتلي لنماذج فضاء الحالة يوازن بين بعض التناسق المكاني وزيادة الذاكرة الزمنية، بالإضافة إلى انتباه محلي كثيف للحفاظ على التفاصيل الدقيقة. استراتيجيتان للتدريب، هما "توجيه الانتشار" و"انتباه الإطار المحلي"، تعملان على تحسين الأداء في السياقات الطويلة. تظهر التقييمات على مجموعتي بيانات Memory Maze وMinecraft أن النموذج المقترح يتفوق بشكل كبير على النماذج الأساسية في الحفاظ على الذاكرة طويلة المدى مع الحفاظ على سرعات استدلال عملية.
المصدر: Synced —
الأصلي
