PEVA: Whole-Body Motion Guided Ego-Centric Video Prediction
Onderzoekers van BAIR (Berkeley AI) introduceerden het PEVA-model (Predicting Ego-centric Video from human Actions), dat volgende first-person videoframes genereert op basis van eerdere frames en een reeks menselijke acties, gespecificeerd via 3D-poses. Het model gebruikt een autoregressieve conditionele diffusietransformator, getraind op de Nymeria-dataset, en kan atomaire acties voorspellen, tegenfeitelijke scenario's simuleren en lange video's genereren tot 16 seconden. PEVA kan ook worden gebruikt voor planning door verschillende actiereeksen te evalueren op basis van gelijkenis met een doelbeeld.
Berkeley Artificial Intelligence Research (BAIR)
