Исследования 🇺🇸 27.07.2026 17:06

Adobe Research и учёные из Стэнфорда и Принстона предложили видео-модели мира с долгосрочной памятью на базе State-Space Models

Princeton University (Sengupta Lab)Princeton University (Sengupta Lab)
Исследователи из Adobe Research, Стэнфордского и Принстонского университетов разработали архитектуру LSSVWM для видео-моделей мира, которая решает проблему долгосрочной памяти. Модель использует State-Space Models (SSMs) и блоковую схему сканирования, а также плотное локальное внимание, чтобы совместить эффективность с сохранением контекста. Эксперименты на наборах данных Memory Maze и Minecraft показали значительное улучшение сохранения информации на больших временных интервалах.
Видео-модели мира, предсказывающие будущие кадры на основе действий, перспективны для ИИ, позволяя агентам планировать и рассуждать в динамической среде. Однако их ключевой недостаток — ограниченная долгосрочная память из-за квадратичной вычислительной сложности механизмов внимания при обработке длинных последовательностей. В новой работе исследователей из Стэнфордского университета,
Показать ещё ↓
Сокращения
LSSVWM = Long-Context State-Space Video World Model — видео-модель мира с долгим контекстом на основе пространства состояний
SSM = State-Space Model — модель пространства состояний
Источник: Synced — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости