PEVA: Egocentrische Video Voorspellen op Basis van Lichaamsacties
Berkeley Artificial Intelligence Research (BAIR)
Onderzoekers van BAIR (Berkeley AI) introduceren PEVA, een model dat egocentrische videobeelden voorspelt op basis van menselijke lichaamsacties. Het gebruikt een autoregressieve conditionele diffusietransformer getraind op de Nymeria-dataset, waarmee atomaire actiesynthese, contrafeitelijke simulatie en lange videogeneratie mogelijk worden. PEVA kan ook worden gebruikt voor visuele planning door actiereeksen te optimaliseren.
PEVA (Predicting Ego-centric Video from human Actions) is een model ontwikkeld door BAIR dat toekomstige egocentrische videoframes genereert op basis van eerdere frames en een reeks lichaamsacties die worden weergegeven als 48-dimensionale kinematische pose-trajecten. Het breidt de Conditional Diffusion Transformer (CDiT) uit met willekeurige timeskips, training op sequentieniveau en actie-embeddings. Getraind op de Nymeria-dataset, die egocentrische video koppelt aan vastgelegde lichaamshoudingen, kan PEVA atomaire acties, tegenfeitelijke scenario's en lange videoreeksen van 16 seconden simuleren. Het ondersteunt ook planning door actiesequenties te optimaliseren met behulp van de Cross-Entropie Methode om de perceptuele gelijkenis (LPIPS, Learned Perceptual Image Patch Similarity) met een doelafbeelding te minimaliseren. Het model presteert beter dan baselines in perceptuele kwaliteit en vertoont schaaleigenschappen met modelgrootte.
Bron: BAIR (Berkeley AI) —
origineel
