الأبحاثالعوامل 🇺🇸 27.07.2026 17:05

PEVA: التنبؤ بالفيديو من منظور الشخص الأول باستخدام حركات الجسم بالكامل

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
قدم باحثون من BAIR (مختبر بركلي للذكاء الاصطناعي) نموذج PEVA (التنبؤ بالفيديو من منظور الشخص الأول باستخدام الأفعال البشرية) الذي يولد إطارات الفيديو التالية من منظور الشخص الأول بناءً على الإطارات السابقة وسلسلة من الأفعال البشرية المحددة عبر تغييرات الوضع ثلاثي الأبعاد. يستخدم النموذج محول انتشار شرطي ذاتي الانحدار مدرب على مجموعة بيانات Nymeria، ويمكنه التنبؤ بالأفعال الذرية، ومحاكاة السيناريوهات المضادة للواقع، ودعم توليد فيديو طويل يصل إلى 16 ثانية. يمكن أيضًا استخدام PEVA في التخطيط من خلال تقييم تسلسلات أفعال مختلفة بناءً على التشابه مع صورة مستهدفة.
قام باحثون من BAIR (مختبر أبحاث الذكاء الاصطناعي في بيركلي) بتطوير نموذج PEVA (التنبؤ بالفيديو من منظور الشخص الأول بناءً على الأفعال البشرية)، والذي يتنبأ بالإطار التالي للفيديو من منظور الشخص الأول بناءً على الإطارات السابقة وتسلسل الأفعال البشرية المعطاة من خلال تغييرات الوضعية ثلاثية الأبعاد. الهدف هو إنشاء نموذج عالمي للوكلاء المتجسدين، مع مراعاة التحكم الهرمي المعقد لكامل الجسم (أكثر من 48 درجة حرية) والمنظر من منظور الشخص الأول. يستخدم PEVA محول انتشار شرطي ذاتي الانحدار، تم تدريبه على مجموعة بيانات Nymeria، والتي تحتوي على فيديوهات متزامنة من منظور الشخص الأول وتسجيل حركات الجسم. يقوم النموذج بتشفير الأفعال كمتجهات بأبعاد 48 (3 لوضعية الجذع و45 للدورانات النسبية لـ 15 مفصلًا في الجزء العلوي من الجسم) ويستخدم حذفًا عشوائيًا عبر الزمن، التدريب على مستوى التسلسل، وتضمين الأفعال. في مرحلة الاختبار، يولد PEVA الإطارات بطريقة ذاتية الانحدار: بناءً على الإطارات السياقية والفعل الحالي، يُتوقع الإطار التالي، الذي يُضاف إلى السياق، بينما يُحذف أقدم إطار. النموذج قادر على توليد أفعال ذرية (حركات اليدين والجسم)، محاكاة السيناريوهات المضادة للواقع، وإنشاء فيديوهات متناسقة لمدة 16 ثانية. للتخطيط، يستخدم PEVA طريقة الإنتروبيا المتقاطعة لتحسين تسلسل الأفعال، وتقييمها بناءً على التشابه مع الصورة المستهدفة (مقياس LPIPS). النتائج الكمية تُظهر أن PEVA يتفوق على النماذج الأساسية في المقاييس الإدراكية (FID) ويتمدد جيدًا مع زيادة حجم النموذج. تشمل القيود غياب مراعاة صريحة لأهداف المهمة والحاجة إلى تحكم بحلقة مغلقة.
المصدر: BAIR (Berkeley AI) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة