研究モデル 🇺🇸 27.07.2026 17:06

Adobe Research、スタンフォード大学、プリンストン大学の研究者が、状態空間モデルに基づく長期記憶を持つビデオワールドモデルを提案

Princeton University (Sengupta Lab)Princeton University (Sengupta Lab)
スタンフォード大学、プリンストン大学、Adobe Researchの研究者らは、状態空間モデルを用いて時系列メモリを効率的に拡張する新しいビデオワールドモデルアーキテクチャ「LSSVWM」を開発しました。このモデルは、アテンションメカニズムの二次計算コストに対処するために、ブロック単位のSSMスキャンと高密度ローカルアテンションを採用し、MinecraftやMemory Maze環境での空間検索や推論などのタスクにおいて長期記憶を実現します。
スタンフォード大学、プリンストン大学、Adobe Researchの研究者による新たな論文「Long-Context State-Space Video World Models」は、ビデオワールドモデルにおける長期記憶のボトルネックに対する解決策を提案しています。中核的な問題は、従来のアテンション層がシーケンス長に対して二次的な計算複雑性を持ち、長期記憶が非現実的になってしまうことです。著者らは、Long-Context State-Space Video World Model(LSSVWM)を導入し、効率的な因果的シーケンスモデリングにState-Space Models(SSMs)を活用しています。重要な設計上の選択として、一部の空間的一貫性と引き換えに時間的記憶を拡張するブロック単位のSSMスキャン方式と、細かい詳細を維持するための密な局所アテンションが挙げられます。2つの学習戦略、Diffusion ForcingとFrame Local Attentionが、長文脈性能をさらに向上させます。Memory MazeおよびMinecraftデータセットでの評価では、LSSVWMが実用的な推論速度を維持しながら、長期的な記憶保持においてベースラインを大幅に上回ることが示されました。
出典: Synced — 原文
関連記事 ↓
新着ニュース