OnderzoekModellen 🇺🇸 27.07.2026 17:06

Adobe Research en wetenschappers van Stanford en Princeton stellen videowereldmodellen met langetermijngeheugen voor op basis van toestands-ruimtemodellen

Princeton University (Sengupta Lab)Princeton University (Sengupta Lab)
Onderzoekers van Stanford University, Princeton University en Adobe Research hebben een nieuwe architectuur voor videowereldmodellen ontwikkeld, genaamd LSSVWM, die gebruikmaakt van toestands-ruimtemodellen om het temporele geheugen efficiënt uit te breiden. Het model lost de kwadratische rekenkosten van aandachtsmechanismen op door bloksgewijze SSM-scanning en dichte lokale aandacht te gebruiken, waardoor langetermijngeheugen mogelijk wordt voor taken zoals ruimtelijk ophalen en redeneren in Minecraft- en Memory Maze-omgevingen.
In een nieuw artikel, "Long-Context State-Space Video World Models" van onderzoekers van Stanford University, Princeton University en Adobe Research, wordt een oplossing voorgesteld voor de knelpunt van langetermijngeheugen in videowereldmodellen. Het kernprobleem is dat traditionele aandachtslagen een kwadratische computationele complexiteit hebben ten opzichte van de sequentielengte, wat langetermijngeheugen onpraktisch maakt. De auteurs introduceren het Long-Context State-Space Video World Model (LSSVWM), dat gebruikmaakt van State-Space Models (SSM's) voor efficiënt causaal sequentiemodelleren. Belangrijke ontwerpkeuzes zijn onder andere een bloksgewijs SSM-scanschema dat wat ruimtelijke consistentie inruilt voor uitgebreid temporeel geheugen, en dichte lokale aandacht om fijne details te behouden. Twee trainingsstrategieën, Diffusion Forcing en Frame Local Attention, verbeteren de prestaties op lange context verder. Evaluaties op de Memory Maze- en Minecraft-datasets tonen aan dat LSSVWM aanzienlijk beter presteert dan basislijnen in het behouden van langetermijngeheugen, terwijl praktische inferentiesnelheden worden gehandhaafd.
Bron: Synced — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws