PEVA: Predicción de Video Egocéntrico a partir de Acciones del Cuerpo Completo
Berkeley Artificial Intelligence Research (BAIR)
Investigadores de BAIR (Berkeley AI) presentan PEVA, un modelo que predice fotogramas de video egocéntrico a partir de acciones del cuerpo completo humano. Utiliza un transformador de difusión condicional autorregresivo entrenado en el conjunto de datos Nymeria, lo que permite la síntesis de acciones atómicas, simulación contrafactual y generación de video largo. PEVA también se puede utilizar para planificación visual optimizando secuencias de acciones.
PEVA (sigla en inglés de Predicción de Video Egocéntrico a partir de Acciones Humanas) es un modelo desarrollado por BAIR que genera fotogramas de video egocéntrico futuros condicionados a fotogramas pasados y a una secuencia de acciones corporales completas representadas como trayectorias cinemáticas de pose de 48 dimensiones. Extiende el Transformer de Difusión Condicional (CDiT) con saltos temporales aleatorios, entrenamiento a nivel de secuencia y embeddings de acciones. Entrenado en el conjunto de datos Nymeria, que empareja video egocéntrico con captura de pose corporal, PEVA puede simular acciones atómicas, contrafácticos y despliegues de video largos de 16 segundos. También admite planificación mediante la optimización de secuencias de acciones usando el Método de Entropía Cruzada para minimizar la similitud perceptual (LPIPS) con una imagen objetivo. El modelo supera a las líneas base en calidad perceptual y muestra propiedades de escalado con el tamaño del modelo.
Fuente: BAIR (Berkeley AI) —
original
