последовательностей и встраивания действий. Обученная на наборе данных Nymeria, который объединяет эгоцентричное видео с захватом позы тела, PEVA способна моделировать атомарные действия, контрфактические сценарии и длинные 16-секундные видеоразвертки. Она также поддерживает планирование путем оптимизации последовательностей действий с использованием метода кросс-энтропии для минимизации перцептивного сходства (LPIPS) с целевым изображением. Модель превосходит базовые методы по перцептивному качеству и демонстрирует масштабируемость в зависимости от размера модели.