PEVA : Prédiction de Vidéo Egocentrique Guidée par les Mouvements du Corps Entier
Des chercheurs du BAIR (Berkeley AI) ont introduit le modèle PEVA (Predicting Ego-centric Video from human Actions), qui génère les prochaines images vidéo à la première personne à partir d'images passées et d'une séquence d'actions humaines spécifiées via des changements de pose 3D. Le modèle utilise un transformateur de diffusion conditionnel autorégressif entraîné sur l'ensemble de données Nymeria et peut prédire des actions atomiques, simuler des scénarios contrefactuels et prendre en charge la génération de longues vidéos allant jusqu'à 16 secondes. PEVA peut également être utilisé pour la planification en évaluant différentes séquences d'actions en fonction de leur similarité avec une image cible.
Berkeley Artificial Intelligence Research (BAIR)
