PEVA : Prédiction de Vidéo Egocentrique Guidée par les Mouvements du Corps Entier
Berkeley Artificial Intelligence Research (BAIR)
Des chercheurs du BAIR (Berkeley AI) ont introduit le modèle PEVA (Predicting Ego-centric Video from human Actions), qui génère les prochaines images vidéo à la première personne à partir d'images passées et d'une séquence d'actions humaines spécifiées via des changements de pose 3D. Le modèle utilise un transformateur de diffusion conditionnel autorégressif entraîné sur l'ensemble de données Nymeria et peut prédire des actions atomiques, simuler des scénarios contrefactuels et prendre en charge la génération de longues vidéos allant jusqu'à 16 secondes. PEVA peut également être utilisé pour la planification en évaluant différentes séquences d'actions en fonction de leur similarité avec une image cible.
Des chercheurs du BAIR (Berkeley Artificial Intelligence Research) ont développé le modèle PEVA (Predicting Ego-centric Video from human Actions), qui prédit l'image suivante d'une vidéo égocentrique à partir des images passées et d'une séquence d'actions humaines, définies par les variations de la pose 3D. L'objectif est de créer un modèle du monde pour des agents incarnés, prenant en compte le contrôle hiérarchique complexe de l'ensemble du corps (plus de 48 degrés de liberté) et une vue égocentrique. PEVA utilise un transformateur à diffusion conditionnelle autorégressif, entraîné sur l'ensemble de données Nymeria, qui contient des vidéos égocentriques synchronisées et des captures de mouvements corporels. Le modèle encode les actions sous forme de vecteurs de dimension 48 (3 pour la position du torse et 45 pour les rotations relatives des 15 articulations du haut du corps) et utilise des sauts temporels aléatoires, un apprentissage au niveau des séquences et des embeddings d'actions. Lors de la phase de test, PEVA génère les images de manière autorégressive : à partir des images de contexte et de l'action courante, l'image suivante est prédite, puis ajoutée au contexte, tandis que la plus ancienne est supprimée. Le modèle est capable de générer des actions atomiques (mouvements des mains et du corps), de simuler des scénarios contrefactuels et de créer des vidéos cohérentes de 16 secondes. Pour la planification, PEVA utilise la méthode de l'entropie croisée afin d'optimiser la séquence d'actions, en les évaluant selon leur similarité avec une image cible (métrique LPIPS). Les résultats quantitatifs montrent que PEVA surpasse les modèles de base selon les métriques perceptuelles (FID) et se scale bien avec l'augmentation de la taille du modèle. Les limites incluent l'absence de prise en compte explicite des objectifs de la tâche et la nécessité d'une boucle de contrôle fermée.
Source: BAIR (Berkeley AI) —
original
