Peneliti Adobe Research, Stanford, dan Princeton Usulkan Model Dunia Video dengan Memori Jangka Panjang Berbasis Model Ruang-Keadaan
Princeton University (Sengupta Lab)
Para peneliti dari Universitas Stanford, Universitas Princeton, dan Adobe Research telah mengembangkan arsitektur model dunia video baru yang disebut LSSVWM yang menggunakan Model Ruang-Keadaan (State-Space Models) untuk memperpanjang memori temporal secara efisien. Model ini mengatasi biaya komputasi kuadrat dari mekanisme perhatian dengan menggunakan pemindaian SSM berbasis blok dan perhatian lokal padat, memungkinkan memori jangka panjang untuk tugas-tugas seperti pengambilan spasial dan penalaran di lingkungan Minecraft dan Memory Maze.
Sebuah makalah baru berjudul "Long-Context State-Space Video World Models" oleh para peneliti dari Universitas Stanford, Universitas Princeton, dan Adobe Research mengusulkan solusi untuk hambatan memori jangka panjang pada model dunia video. Masalah utamanya adalah bahwa lapisan perhatian tradisional memiliki kompleksitas komputasi kuadratik terhadap panjang sekuens, sehingga memori jangka panjang menjadi tidak praktis. Para penulis memperkenalkan Long-Context State-Space Video World Model (LSSVWM), yang memanfaatkan Model Ruang Keadaan (State-Space Models/SSMs) untuk pemodelan sekuens kausal yang efisien. Pilihan desain kunci meliputi skema pemindaian SSM berbasis blok yang mengorbankan sebagian konsistensi spasial untuk memori temporal yang diperpanjang, serta perhatian lokal padat untuk mempertahankan detail yang halus. Dua strategi pelatihan, yaitu Diffusion Forcing dan Frame Local Attention, semakin meningkatkan kinerja konteks panjang. Evaluasi pada kumpulan data Memory Maze dan Minecraft menunjukkan bahwa LSSVWM secara substansial melampaui garis dasar dalam mempertahankan memori jangka panjang sambil mempertahankan kecepatan inferensi yang praktis.
Sumber: Synced —
asli
