PEVA: Ganzkörperbewegung gesteuerte egozentrische Videovorhersage
Forscher von BAIR (Berkeley AI) stellten das PEVA-Modell (Predicting Ego-centric Video from human Actions) vor, das aus vergangenen Frames und einer Sequenz menschlicher Aktionen, spezifiziert durch 3D-Posenänderungen, nächste Ich-Perspektive-Videobilder generiert. Das Modell verwendet einen autoregressiven, bedingten Diffusionstransformator, der auf dem Nymeria-Datensatz trainiert wurde, und kann atomare Aktionen vorhersagen, kontrafaktische Szenarien simulieren und lange Videogenerierung von bis zu 16 Sekunden unterstützen. PEVA kann auch zur Planung verwendet werden, indem verschiedene Aktionssequenzen basierend auf der Ähnlichkeit zu einem Zielbild bewertet werden.
Berkeley Artificial Intelligence Research (BAIR)
