PEVA: संपूर्ण शारीरिक क्रियाओं से अहमकेंद्रित वीडियो की भविष्यवाणी

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
BAIR (बर्कले एआई) के शोधकर्ताओं ने PEVA प्रस्तुत किया है, एक मॉडल जो मानव संपूर्ण शारीरिक क्रियाओं से अहमकेंद्रित वीडियो फ्रेमों की भविष्यवाणी करता है। यह न्यूमेरिया डेटासेट पर प्रशिक्षित एक ऑटोरेग्रेसिव कंडीशनल डिफ्यूजन ट्रांसफॉर्मर का उपयोग करता है, जो परमाणु क्रिया संश्लेषण, काउंटरफैक्चुअल सिमुलेशन और लंबी वीडियो जनरेशन को सक्षम बनाता है। PEVA का उपयोग क्रिया अनुक्रमों को अनुकूलित करके दृश्य योजना के लिए भी किया जा सकता है।
PEVA (प्रेडिक्टिंग इगो-सेंट्रिक वीडियो फ्रॉम ह्यूमन एक्शन्स) BAIR द्वारा विकसित एक मॉडल है जो पिछले फ्रेम और 48-आयामी काइनेमैटिक पोज़ ट्रैजेक्टरी के रूप में प्रस्तुत पूरे शरीर की क्रियाओं के अनुक्रम पर आधारित भविष्य के इगो-सेंट्रिक वीडियो फ्रेम उत्पन्न करता है। यह कंडीशनल डिफ्यूज़न ट्रांसफॉर्मर (CDiT) को रैंडम टाइमस्किप्स, सीक्वेंस-लेवल ट्रेनिंग और एक्शन एम्बेडिंग के साथ विस्तारित करता है। निमेरिया डेटासेट पर प्रशिक्षित, जो इगो-सेंट्रिक वीडियो को बॉडी पोज़ कैप्चर के साथ जोड़ता है, PEVA परमाणु क्रियाओं, काउंटरफैक्टुअल और लंबे 16 सेकंड के वीडियो रोलआउट का अनुकरण कर सकता है। यह क्रॉस-एंट्रॉपी मेथड का उपयोग करके एक्शन सीक्वेंस को ऑप्टिमाइज़ करके योजना बनाने का भी समर्थन करता है ताकि गोल इमेज के प्रति अवधारणात्मक समानता (LPIPS) को कम किया जा सके। यह मॉडल अवधारणात्मक गुणवत्ता में बेसलाइन से बेहतर प्रदर्शन करता है और मॉडल आकार के साथ स्केलिंग गुण दिखाता है।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार