Kandinsky WM 1.0:物理AI向け生成モデル
Сбер
NVIDIA
Meta
Sberは、自律走行車、ロボット工学、複雑な物理シナリオ向けに設計された3つの画像から動画への変換モデル群「Kandinsky WM 1.0」をリリースしました。これらのモデルはKandinsky 5.0 Video Liteを基盤としており、MITライセンスで提供され、物理的に正確な合成動画を生成することで物理AIにおけるデータ不足に対処することを目的としています。
Sberは、Physical AI向けの3つの専門ビデオ生成モデルからなるセットであるKandinsky WM 1.0をオープンソース化しました。これには、自動運転車向けのK5-AV、ロボット工学向けのK5-RO、複雑な物理現象を含むシーン向けのK5-PHが含まれます。これらのモデルは、20億パラメータのKandinsky 5.0 Video Liteを基盤としており、画像からビデオへのモードで動作し、最初のフレームとテキストプロンプトを受け取って続きを生成します。各モデルは特定のデータセットに対してドメイン適応が行われています。K5-AVはNVIDIA PhysicalAI Autonomous Vehiclesからの150万本のビデオ、K5-ROはGenRobot 10Kh RealOmniやAgiBot World Betaなどのさまざまなソースからの220万本のロボット工学ビデオ、K5-PHは事前学習からの130万本と300,000本の手動キュレーションによる160万本の物理ビデオを使用しています。ドメイン適応後、モデルは第2のトレーニング段階を経ています。K5-AVとK5-ROでは報酬モデルを用いた強化学習、K5-PHではSOARを適用しています。このリリースには、MITライセンスの下でのコードと重みが含まれています。記事ではまた、Physical AIにおけるロングテールデータ問題についても強調しています。これは、稀なシナリオが重要である一方で収集が困難であるという問題です。また、現在のビデオ生成モデルは物理的忠実度に欠けることが多く、ドメイン固有のトレーニングとポストトレーニングが必要であると指摘しています。
出典: Habr — хаб ML —
原文
