PEVA: Previsão de Vídeo Ego-Cêntrico Guiada por Movimentos do Corpo Inteiro
Pesquisadores do BAIR (Berkeley AI) apresentaram o modelo PEVA (Predicting Ego-centric Video from human Actions), que gera os próximos quadros de vídeo em primeira pessoa com base em quadros passados e em uma sequência de ações humanas especificadas por meio de mudanças na pose 3D. O modelo utiliza um transformador de difusão condicional autorregressivo treinado no conjunto de dados Nymeria e pode prever ações atômicas, simular cenários contrafactuais e gerar vídeos longos de até 16 segundos. O PEVA também pode ser usado para planejamento, avaliando diferentes sequências de ações com base na similaridade com uma imagem alvo.
Berkeley Artificial Intelligence Research (BAIR)
