ИсследованияАгенты 🇺🇸 27.07.2026 17:05

PEVA: предсказание эгоцентричного видео на основе движений всего тела

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Исследователи из BAIR (Berkeley AI) представили модель PEVA (Predicting Ego-centric Video from human Actions), которая генерирует следующее видео с точки зрения первого лица на основе прошлых кадров и последовательности действий человека, заданных через изменения 3D-позы. Модель использует авторегрессионный условный диффузионный трансформер, обученный на наборе данных Nymeria, и способна предсказывать атомарные действия, имитировать контрфактические сценарии и поддерживать генерацию длинных видео до 16 секунд. PEVA также может использоваться для планирования, оценивая различные последовательности действий по сходству с целевым изображением.
Исследователи из BAIR (Berkeley AI) разработали модель PEVA (Predicting Ego-centric Video from human Actions), которая предсказывает следующий кадр эгоцентричного видео на основе прошлых кадров и последовательности действий человека, заданных через изменения 3D-позы. Цель — создать мировую модель для воплощённых агентов, учитывающую сложное, иерархическое управление всем телом (48+ степеней
Показать ещё ↓
Сокращения
PEVA = Predicting Ego-centric Video from human Actions — предсказание эгоцентричного видео по действиям человека
VAE = Variational Autoencoder — вариационный автоэнкодер
LPIPS = Learned Perceptual Image Patch Similarity — обученная перцептивная метрика сходства фрагментов изображений
FID = Fréchet Inception Distance — расстояние Фреше по признакам Inception
CEM = Cross-Entropy Method — метод кросс-энтропии
CDiT = Conditional Diffusion Transformer — условный диффузионный трансформер
AdaLN = Adaptive Layer Normalization — адаптивная нормализация слоя
Источник: BAIR (Berkeley AI) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости