PEVA: Vorhersage egozentrischer Videos aus Ganzkörperaktionen
Forscher von BAIR (Berkeley KI) stellen PEVA vor, ein Modell, das egozentrische Videobilder aus menschlichen Ganzkörperaktionen vorhersagt. Es verwendet einen autoregressiven konditionalen Diffusionstransformer, der auf dem Nymeria-Datensatz trainiert wurde, und ermöglicht atomare Aktionssynthese, kontrafaktische Simulation und lange Videogenerierung. PEVA kann auch für visuelle Planung durch Optimierung von Aktionssequenzen eingesetzt werden.
Berkeley Artificial Intelligence Research (BAIR)
