PEVA: прогнозирование эгоцентрического видео на основе движений всего тела
Исследователи из BAIR (Berkeley AI) представили модель PEVA, которая предсказывает кадры эгоцентрического видео на основе движений всего тела человека. Модель использует авторегрессивный условный диффузионный трансформер, обученный на датасете Nymeria, что позволяет синтезировать атомарные действия, проводить контрфактическое моделирование и генерировать длинные видео. PEVA также может применяться для визуального планирования путем оптимизации последовательностей действий.
Berkeley Artificial Intelligence Research (BAIR)
BAIR (Berkeley AI)27.07 · 17:05
