PEVA: Whole-Body Motion Guided Ego-Centric Video Prediction
Berkeley Artificial Intelligence Research (BAIR)
Onderzoekers van BAIR (Berkeley AI) introduceerden het PEVA-model (Predicting Ego-centric Video from human Actions), dat volgende first-person videoframes genereert op basis van eerdere frames en een reeks menselijke acties, gespecificeerd via 3D-poses. Het model gebruikt een autoregressieve conditionele diffusietransformator, getraind op de Nymeria-dataset, en kan atomaire acties voorspellen, tegenfeitelijke scenario's simuleren en lange video's genereren tot 16 seconden. PEVA kan ook worden gebruikt voor planning door verschillende actiereeksen te evalueren op basis van gelijkenis met een doelbeeld.
Onderzoekers van BAIR (Berkeley Artificiële Intelligentie) hebben het model PEVA (Predicting Ego-centric Video from human Actions) ontwikkeld, dat het volgende frame van een egocentrische video voorspelt op basis van eerdere frames en een reeks menselijke acties, gespecificeerd via veranderingen in de 3D-houding. Het doel is om een wereldmodel te creëren voor belichaamde agenten dat rekening houdt met complexe, hiërarchische aansturing van het hele lichaam (48+ vrijheidsgraden) en een egocentrisch perspectief. PEVA gebruikt een autoregressieve conditionele diffusietransformator, getraind op de Nymeria-dataset, die gesynchroniseerde egocentrische video's en bewegingscapture van het lichaam bevat. Het model codeert acties als vectoren van dimensie 48 (3 voor de positie van de romp en 45 voor relatieve rotaties van 15 gewrichten van het bovenlichaam) en gebruikt willekeurige gaten in de tijd, training op sequentieniveau en actie-inbeddingen. Tijdens de testfase genereert PEVA frames autoregressief: op basis van contextframes en de huidige actie wordt het volgende frame voorspeld, dat aan de context wordt toegevoegd, waarna het oudste frame wordt verwijderd. Het model kan atomaire acties (hand- en lichaamsbewegingen) genereren, contrafactische scenario's simuleren en consistente video's van 16 seconden maken. Voor planning gebruikt PEVA de kruis-entropiemethode om een reeks acties te optimaliseren, waarbij ze worden geëvalueerd op overeenkomst met een doelafbeelding (LPIPS-metriek). Kwantitatieve resultaten tonen aan dat PEVA basismodellen overtreft op perceptuele metrieken (FID) en goed schaalt met een groter model. Beperkingen zijn onder andere het ontbreken van expliciete taakdoelen en de noodzaak van een gesloten regelkring.
Bron: BAIR (Berkeley AI) —
origineel
