PEVA : Prédire la vidéo égocentrique à partir des actions du corps entier
Des chercheurs du BAIR (Berkeley AI) présentent PEVA, un modèle qui prédit les images vidéo égocentriques à partir des actions du corps entier humain. Il utilise un transformateur de diffusion conditionnelle autorégressif entraîné sur l'ensemble de données Nymeria, permettant la synthèse d'actions atomiques, la simulation contrefactuelle et la génération de longues vidéos. PEVA peut également être utilisé pour la planification visuelle en optimisant les séquences d'actions.
Berkeley Artificial Intelligence Research (BAIR)
