PEVA: Predicción de Video Ego-céntrico Guiada por Movimientos de Cuerpo Completo
Investigadores de BAIR (Berkeley AI) presentaron el modelo PEVA (Predicting Ego-centric Video from human Actions), que genera los siguientes fotogramas de video en primera persona a partir de fotogramas pasados y una secuencia de acciones humanas especificadas mediante cambios de pose 3D. El modelo utiliza un transformer de difusión condicional autorregresivo entrenado en el conjunto de datos Nymeria y puede predecir acciones atómicas, simular escenarios contrafácticos y admitir la generación de videos largos de hasta 16 segundos. PEVA también se puede utilizar para la planificación evaluando diferentes secuencias de acción en función de la similitud con una imagen objetivo.
Berkeley Artificial Intelligence Research (BAIR)
