RisetGenerasi Media 🇺🇸 27.07.2026 17:05

PEVA: Memprediksi Video Egocentric dari Aksi Seluruh Tubuh

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Peneliti dari BAIR (Berkeley AI) memperkenalkan PEVA, sebuah model yang memprediksi bingkai video egosentris dari aksi seluruh tubuh manusia. Model ini menggunakan transformer difusi kondisional autoregresif yang dilatih pada dataset Nymeria, memungkinkan sintesis aksi atomik, simulasi kontrafaktual, dan generasi video panjang. PEVA juga dapat digunakan untuk perencanaan visual dengan mengoptimalkan urutan aksi.
PEVA (Predicting Ego-centric Video dari Tindakan Manusia) adalah model yang dikembangkan oleh BAIR yang menghasilkan frame video egosentris masa depan berdasarkan frame masa lalu dan urutan tindakan seluruh tubuh yang direpresentasikan sebagai lintasan pose kinematik 48 dimensi. Model ini memperluas Conditional Diffusion Transformer (CDiT) dengan lompatan waktu acak, pelatihan tingkat sekuens, dan embedding tindakan. Dilatih pada dataset Nymeria, yang memasangkan video egosentris dengan penangkapan pose tubuh, PEVA dapat mensimulasikan tindakan atomik, kontrafaktual, dan gulungan video panjang 16 detik. Model ini juga mendukung perencanaan dengan mengoptimalkan urutan tindakan menggunakan Metode Cross-Entropy untuk meminimalkan kemiripan perseptual (LPIPS) dengan gambar tujuan. Model ini mengungguli basis acuan dalam kualitas perseptual dan menunjukkan sifat penskalaan dengan ukuran model.
Sumber: BAIR (Berkeley AI) — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru