PEVA: Tüm Vücut Hareketlerinden Benmerkezci Video Tahmini
Berkeley Artificial Intelligence Research (BAIR)
BAIR (Berkeley AI) araştırmacıları, insan tüm vücut hareketlerinden benmerkezci video karelerini tahmin eden bir model olan PEVA'yı tanıtıyor. Model, Nymeria veri kümesi üzerinde eğitilmiş bir otoregresif koşullu difüzyon transformatörü kullanarak atomik eylem sentezi, karşıolgusal simülasyon ve uzun video üretimi sağlıyor. PEVA ayrıca eylem dizilerini optimize ederek görsel planlama için de kullanılabiliyor.
PEVA (Geçmişten Gelecekteki Ego-merkezli Videoyu Tahmin Etme), BAIR tarafından geliştirilen ve geçmiş kareler ile 48 boyutlu kinematik poz yörüngeleri olarak temsil edilen bir dizi tüm vücut eylemleri koşulunda gelecekteki ego-merkezli video karelerini üreten bir modeldir. Rastgele zaman atlamaları, dizi düzeyinde eğitim ve eylem gömmeleri ile Koşullu Difüzyon Dönüştürücüsünü (CDiT) genişletir. Ego-merkezli videoyu vücut poz yakalaması ile eşleştiren Nymeria veri seti üzerinde eğitilen PEVA, atomik eylemleri, karşıolgusal senaryoları ve 16 saniyelik uzun video çıktılarını simüle edebilir. Ayrıca, bir hedef görüntüye olan algısal benzerliği (LPIPS) en aza indirmek için Çapraz Entropi Yöntemi'ni kullanarak eylem dizilerini optimize ederek planlamayı destekler. Model, algısal kalitede temel çizgileri geride bırakır ve model boyutuyla ölçekleme özellikleri gösterir.
Kaynak: BAIR (Berkeley AI) —
orijinal
