PEVA: Egocentrisen videon ennustaminen koko kehon toimista
Berkeley Artificial Intelligence Research (BAIR)
Berkeley AI -tutkimusryhmän kehittämä PEVA-malli ennustaa egocentrisiä videokuvia ihmisen koko kehon toimintojen perusteella. Se käyttää autoregressiivistä ehdollista diffuusiomuunninta, joka on koulutettu Nymeria-tietoaineistolla, mahdollistaen atomisten toimintojen synteesin, kontrafaktuaalisen simuloinnin ja pitkien videoiden tuottamisen. PEVA:ta voidaan käyttää myös visuaaliseen suunnitteluun optimoimalla toimintosarjoja.
PEVA (Predicting Ego-centric Video from human Actions, eli egosentriseen videon ennustaminen ihmisen toiminnasta) on BAIR:n kehittämä malli, joka tuottaa tulevia egosentrisiä videokuvia aiempien kuvien ja 48-ulotteisina kinemaattisina asentoratoina esitetyn koko kehon toimintosarjan perusteella. Se laajentaa ehdollista diffuusiomuunninta (Conditional Diffusion Transformer, CDiT) satunnaisilla aikahypyillä, sekvenssitason harjoittelulla ja toiminto-upotuksilla. Harjoitettuna Nymeria-tietoaineistolla, joka yhdistää egosentrisen videon kehon asennon tallennukseen, PEVA pystyy simuloimaan atomisia toimintoja, kontrafaktuaaleja ja pitkiä 16 sekunnin videojaksoja. Se tukee myös suunnittelua optimoimalla toimintosarjoja ristientropiamenetelmällä (Cross-Entropy Method) minimoidakseen havainnollisen samankaltaisuuden (LPIPS) tavoitekuvaan. Malli suoriutuu vertailumalleja paremmin havainnollisessa laadussa ja osoittaa skaalautuvuutta mallin koon kasvaessa.
Lähde: BAIR (Berkeley AI) —
Alkuperäinen
