Adobe Research e cientistas de Stanford e Princeton propõem modelos mundiais de vídeo com memória de longo prazo baseados em Modelos Estado-Espaço
Princeton University (Sengupta Lab)
Pesquisadores da Adobe Research, Universidade de Stanford e Universidade de Princeton desenvolveram a arquitetura LSSVWM para modelos mundiais de vídeo que resolve o problema da memória de longo prazo. O modelo utiliza Modelos Estado-Espaço (SSMs) e um esquema de varredura por blocos, além de atenção local densa, para combinar eficiência com retenção de contexto. Experimentos nos conjuntos de dados Memory Maze e Minecraft mostraram melhora significativa na retenção de informações ao longo de longos intervalos de tempo.
Modelos de vídeo do mundo, que preveem quadros futuros com base em ações, são promissores para IA, permitindo que agentes planejem e raciocinem em ambientes dinâmicos. No entanto, sua principal desvantagem é a memória de longo prazo limitada devido à complexidade computacional quadrática dos mecanismos de atenção ao processar sequências longas. Em um novo trabalho de pesquisadores da Universidade de Stanford, da Universidade de Princeton e da Adobe Research, foi proposta a arquitetura Long-Context State-Space Video World Model (LSSVWM), que utiliza State-Space Models (SSMs) para modelagem causal eficiente de sequências. A ideia central é um esquema de varredura por blocos do SSM: a sequência é dividida em blocos, entre os quais um estado comprimido é transmitido, estendendo a memória do modelo. Para compensar a perda de consistência espacial, utiliza-se atenção local densa, garantindo coesão entre quadros adjacentes. Também foram introduzidas duas estratégias de treinamento: diffusion forcing para gerar quadros com contexto inicial mínimo e atenção local de quadros (frame local attention) para acelerar o treinamento e a amostragem com FlexAttention. O modelo foi avaliado nos conjuntos de dados Memory Maze e Minecraft, voltados para testar memória de longo prazo. O LSSVWM superou significativamente as abordagens baseline (incluindo Mamba2) na manutenção de consistência e precisão em horizontes temporais longos, mantendo velocidade prática de inferência. Os resultados foram apresentados em artigo no arXiv.
Fonte: Synced —
original
