PesquisaGeração de Mídia 🇺🇸 27.07.2026 17:05

PEVA: Prevendo Vídeo Egocêntrico a Partir de Ações do Corpo Inteiro

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Pesquisadores do BAIR (Berkeley AI) apresentam o PEVA, um modelo que prevê quadros de vídeo egocêntrico a partir de ações humanas de corpo inteiro. Ele usa um transformador de difusão condicional autorregressivo treinado no conjunto de dados Nymeria, permitindo síntese de ações atômicas, simulação contrafactual e geração de vídeos longos. O PEVA também pode ser usado para planejamento visual, otimizando sequências de ações.
PEVA (Predicting Ego-centric Video from human Actions) é um modelo desenvolvido pela BAIR que gera quadros de vídeo egocêntricos futuros condicionados a quadros passados e a uma sequência de ações do corpo inteiro representadas como trajetórias cinemáticas de poses de 48 dimensões. Ele estende o Diffusion Transformer Condicional (CDiT) com saltos temporais aleatórios, treinamento em nível de sequência e embeddings de ações. Treinado no conjunto de dados Nymeria, que combina vídeo egocêntrico com captura de pose corporal, o PEVA pode simular ações atômicas, contrafactuais e longos rollouts de vídeo de 16 segundos. Ele também suporta planejamento ao otimizar sequências de ações usando o Método de Entropia Cruzada para minimizar a similaridade perceptual (LPIPS) com uma imagem objetivo. O modelo supera as linhas de base em qualidade perceptual e mostra propriedades de escalonamento com o tamanho do modelo.
Fonte: BAIR (Berkeley AI) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas