PEVA:全身動作からの自己中心視点映像予測
Berkeley Artificial Intelligence Research (BAIR)
BAIR(バークレーAI研究所)の研究者らは、人間の全身動作から自己中心視点の映像フレームを予測するモデルPEVAを発表しました。このモデルは、Nymeriaデータセットで学習された自己回帰条件付き拡散トランスフォーマーを使用し、原子アクション合成、反実仮想シミュレーション、長編映像生成を可能にします。PEVAは、アクションシーケンスを最適化することで視覚的な計画にも利用できます。
PEVA(人間の行動から一人称視点動画を予測するモデル)は、BAIRが開発したモデルで、過去のフレームと48次元の運動学的姿勢軌跡として表現される一連の全身行動を条件として、将来の一人称視点動画フレームを生成します。このモデルは、条件付き拡散トランスフォーマー(Conditional Diffusion Transformer: CDiT)を拡張し、ランダムなタイムスキップ、シーケンスレベルでの学習、および行動埋め込みを導入しています。Nymeriaデータセット(一人称視点動画と身体姿勢のキャプチャをペアリングしたもの)で学習されたPEVAは、原子的な行動、反実仮想的な行動、および16秒の長尺動画ロールアウトをシミュレートできます。また、交差エントロピー法(Cross-Entropy Method)を用いて行動シーケンスを最適化し、目標画像との知覚的類似度(LPIPS)を最小化することで、計画機能もサポートします。このモデルは、知覚品質においてベースラインを上回り、モデルサイズに応じたスケーリング特性を示しています。
出典: BAIR (Berkeley AI) —
原文
