AraştırmaModeller 🇺🇸 27.07.2026 17:06

Adobe Araştırma, Stanford ve Princeton Bilim İnsanları Durum-Uzay Modellerine Dayalı Uzun Süreli Belleğe Sahip Video Dünya Modelleri Öneriyor

Princeton University (Sengupta Lab)Princeton University (Sengupta Lab)
Stanford Üniversitesi, Princeton Üniversitesi ve Adobe Araştırma'dan araştırmacılar, zamansal belleği verimli bir şekilde genişletmek için Durum-Uzay Modelleri (State-Space Models - SSM) kullanan LSSVWM adlı yeni bir video dünya modeli mimarisi geliştirdi. Model, blok tabanlı SSM taraması ve yoğun yerel dikkat (attention) kullanarak dikkat mekanizmalarının ikinci dereceden hesaplama maliyetini ele alıyor ve Minecraft ile Memory Maze ortamlarında uzamsal erişim ve akıl yürütme gibi görevler için uzun süreli bellek sağlıyor.
Stanford Üniversitesi, Princeton Üniversitesi ve Adobe Research'ten araştırmacıların yazdığı yeni bir makale olan "Uzun Bağlamlı Durum-Uzayı Video Dünya Modelleri", video dünya modellerindeki uzun vadeli bellek darboğazına bir çözüm öneriyor. Temel sorun, geleneksel dikkat katmanlarının dizi uzunluğuna göre ikinci dereceden hesaplama karmaşıklığına sahip olması ve bu nedenle uzun vadeli belleğin pratik olmamasıdır. Yazarlar, verimli nedensel dizi modellemesi için Durum-Uzayı Modelleri'nden (State-Space Models - SSM) yararlanan Uzun Bağlamlı Durum-Uzayı Video Dünya Modeli'ni (LSSVWM) tanıtıyor. Temel tasarım seçimleri arasında, bazı uzamsal tutarlılığı genişletilmiş zamansal bellek karşılığında takas eden blok bazlı bir SSM tarama şeması ve ince ayrıntıları korumak için yoğun yerel dikkat yer alıyor. İki eğitim stratejisi olan Difüzyon Zorlaması (Diffusion Forcing) ve Çerçeve Yerel Dikkati (Frame Local Attention), uzun bağlam performansını daha da iyileştiriyor. Memory Maze ve Minecraft veri kümeleri üzerinde yapılan değerlendirmeler, LSSVWM'nin pratik çıkarım hızlarını korurken uzun menzilli belleği korumada temel modelleri önemli ölçüde geride bıraktığını gösteriyor.
Kaynak: Synced — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler