PEVA: التنبؤ بالفيديو من منظور الشخص الأول باستخدام حركات الجسم بالكامل
قدم باحثون من BAIR (مختبر بركلي للذكاء الاصطناعي) نموذج PEVA (التنبؤ بالفيديو من منظور الشخص الأول باستخدام الأفعال البشرية) الذي يولد إطارات الفيديو التالية من منظور الشخص الأول بناءً على الإطارات السابقة وسلسلة من الأفعال البشرية المحددة عبر تغييرات الوضع ثلاثي الأبعاد. يستخدم النموذج محول انتشار شرطي ذاتي الانحدار مدرب على مجموعة بيانات Nymeria، ويمكنه التنبؤ بالأفعال الذرية، ومحاكاة السيناريوهات المضادة للواقع، ودعم توليد فيديو طويل يصل إلى 16 ثانية. يمكن أيضًا استخدام PEVA في التخطيط من خلال تقييم تسلسلات أفعال مختلفة بناءً على التشابه مع صورة مستهدفة.
Berkeley Artificial Intelligence Research (BAIR)
