PEVA: Koko kehon liikkeen ohjaama egosenttinen videon ennustus
BAIR (Berkeley AI) -tutkijat esittelivät PEVA-mallin (Predicting Ego-centric Video from human Actions), joka tuottaa seuraavat ensimmäisen persoonan videokuvat perustuen aiempiin kuviin ja ihmisen toimintojen sarjaan, joka on määritelty 3D-asennon muutosten avulla. Malli käyttää autoregressiivistä ehdollista diffuusiotransformeria, joka on koulutettu Nymeria-tietoaineistolla, ja se pystyy ennustamaan atomisia toimintoja, simuloimaan kontrafaktuaalisia skenaarioita ja tukemaan jopa 16 sekunnin pituisten videoiden tuottamista. PEVAa voidaan käyttää myös suunnitteluun arvioimalla eri toimintosarjoja niiden samankaltaisuuden perusteella kohdekuvaan nähden.
Berkeley Artificial Intelligence Research (BAIR)
