研究模型 🇺🇸 27.07.2026 17:06

Adobe Research与斯坦福和普林斯顿科学家提出基于状态空间模型的具有长期记忆的视频世界模型

Princeton University (Sengupta Lab)Princeton University (Sengupta Lab)
来自斯坦福大学、普林斯顿大学和Adobe Research的研究人员开发了一种新的视频世界模型架构LSSVWM,该架构使用状态空间模型高效扩展时间记忆。该模型通过采用分块SSM扫描和密集局部注意力,解决了注意力机制的二次计算成本问题,从而在Minecraft和Memory Maze环境中的空间检索和推理等任务中实现长期记忆。
来自斯坦福大学、普林斯顿大学和Adobe Research的研究人员发表了一篇新论文《长上下文状态空间视频世界模型》,针对视频世界模型中的长期记忆瓶颈提出了解决方案。核心问题在于传统注意力层对序列长度具有二次方计算复杂度,导致长期记忆难以实现。作者提出了长上下文状态空间视频世界模型(LSSVWM),利用状态空间模型(SSM)实现高效的因果序列建模。关键设计包括一种块级SSM扫描策略——以牺牲部分空间一致性为代价换取扩展的时间记忆,以及用于维持细粒度细节的密集局部注意力。两种训练策略——扩散强迫(Diffusion Forcing)和帧局部注意力(Frame Local Attention)——进一步提升了长上下文性能。在Memory Maze和Minecraft数据集上的评估表明,LSSVWM在保持长距离记忆方面大幅超越基线模型,同时保持了实用的推理速度。
来源: Synced — 原文
我们之前关于此话题的帖子 ↓
最新新闻