RechercheGénération Média 🇺🇸 27.07.2026 17:05

PEVA : Prédire la vidéo égocentrique à partir des actions du corps entier

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Des chercheurs du BAIR (Berkeley AI) présentent PEVA, un modèle qui prédit les images vidéo égocentriques à partir des actions du corps entier humain. Il utilise un transformateur de diffusion conditionnelle autorégressif entraîné sur l'ensemble de données Nymeria, permettant la synthèse d'actions atomiques, la simulation contrefactuelle et la génération de longues vidéos. PEVA peut également être utilisé pour la planification visuelle en optimisant les séquences d'actions.
PEVA (Prediction de Vidéo Egocentrique à partir d'Actions Humaines) est un modèle développé par BAIR qui génère des images vidéo égocentriques futures conditionnées par des images passées et une séquence d'actions du corps entier représentées sous forme de trajectoires cinématiques de pose à 48 dimensions. Il étend le Transformateur de Diffusion Conditionnel (CDiT) avec des sauts temporels aléatoires, un entraînement au niveau de la séquence et des embeddings d'actions. Entraîné sur l'ensemble de données Nymeria, qui associe la vidéo égocentrique à la capture de pose corporelle, PEVA peut simuler des actions atomiques, des contrefactuels et de longs déroulements vidéo de 16 secondes. Il prend également en charge la planification en optimisant les séquences d'actions à l'aide de la méthode d'entropie croisée pour minimiser la similarité perceptuelle (LPIPS) avec une image cible. Le modèle surpasse les lignes de base en termes de qualité perceptuelle et présente des propriétés de mise à l'échelle avec la taille du modèle.
Source: BAIR (Berkeley AI) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches