PEVA: прогнозирование эгоцентрического видео на основе движений всего тела

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Исследователи из BAIR (Berkeley AI) представили модель PEVA, которая предсказывает кадры эгоцентрического видео на основе движений всего тела человека. Модель использует авторегрессивный условный диффузионный трансформер, обученный на датасете Nymeria, что позволяет синтезировать атомарные действия, проводить контрфактическое моделирование и генерировать длинные видео. PEVA также может применяться для визуального планирования путем оптимизации последовательностей действий.
PEVA (Predicting Ego-centric Video from human Actions) — это модель, разработанная BAIR, которая генерирует будущие кадры эгоцентричного видео на основе прошлых кадров и последовательности движений всего тела, представленных в виде 48-мерных траекторий кинематических поз. Она расширяет Conditional Diffusion Transformer (CDiT) с помощью случайных пропусков времени, обучения на уровне
Показать ещё ↓
Источник: BAIR (Berkeley AI) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости