PEVA: توقع الفيديو الذاتي من حركات الجسم الكاملة
Berkeley Artificial Intelligence Research (BAIR)
يقدم باحثون من BAIR (مختبر بركلي للذكاء الاصطناعي) نموذج PEVA، الذي يتنبأ بإطارات الفيديو الذاتي من حركات الجسم الكاملة للبشر. يستخدم النموذج محول انتشار شرطي ذاتي التراجع مدربًا على مجموعة بيانات Nymeria، مما يتيح تركيب الأفعال الذرية والمحاكاة المضادة للواقع وتوليد فيديو طويل. يمكن أيضًا استخدام PEVA للتخطيط البصري عن طريق تحسين تسلسل الحركات.
نموذج PEVA (التنبؤ بالفيديو من منظور الشخص الأول بناءً على الأفعال البشرية) هو نموذج طورته BAIR لتوليد إطارات فيديو مستقبلية من منظور الشخص الأول، معتمدة على إطارات سابقة وسلسلة من أفعال الجسم كاملة ممثلة كمسارات حركية ذات 48 بُعدًا. يوسع النموذج محول الانتشار الشرطي (CDiT) بإضافة قفزات زمنية عشوائية، وتدريب على مستوى التسلسل، وتمثيلات للأفعال. دُرب النموذج على مجموعة بيانات Nymeria التي تقترن بين فيديو منظور الشخص الأول وتقاطيع وضعية الجسم، ويمكنه محاكاة الأفعال الذرية والسيناريوهات المخالفة للواقع وإنتاج مقاطع فيديو طويلة طولها 16 ثانية. كما يدعم التخطيط بتحسين تسلسلات الأفعال باستخدام طريقة الإنتروبيا المتقاطعة لتقليل التشابه الإدراكي (LPIPS) مع صورة هدف. يتفوق النموذج على النماذج الأساسية في الجودة الإدراكية ويظهر خصائص تحجيم مع حجم النموذج.
المصدر: BAIR (Berkeley AI) —
الأصلي
