Adobe Research, Stanford und Princeton schlagen Video-Weltmodelle mit Langzeitgedächtnis auf Basis von Zustandsraummodellen vor
Forscher der Stanford University, der Princeton University und von Adobe Research haben eine neue Architektur für Video-Weltmodelle namens LSSVWM entwickelt, die Zustandsraummodelle (State-Space Models, SSMs) nutzt, um das zeitliche Gedächtnis effizient zu erweitern. Das Modell umgeht die quadratischen Rechenkosten von Aufmerksamkeitsmechanismen durch blockweises SSM-Scannen und dichte lokale Aufmerksamkeit und ermöglicht so ein Langzeitgedächtnis für Aufgaben wie räumliches Abrufen und logisches Denken in Minecraft- und Memory-Maze-Umgebungen.
Princeton University (Sengupta Lab)





