Dyna Robotics、100万時間の人間ビデオで事前学習した世界行動モデル「Dyna-2」を発表
Dyna Roboticsは、ロボット操作のための世界行動モデル「Dyna-2」を発表しました。このモデルは100万時間を超える自己中心視点の人間ビデオで事前学習されています。このモデルは、人間データに対するスケーリング則を示し、未見のロボットデータへのゼロショット転送を実現し、ビデオ予測がクロスエンボディメント汎化を促進することを実証しています。Dyna-2は、ベンダーが運用するDynaロボットセルの一部としてのみ利用可能であり、公開チェックポイント、API、ライセンスは提供されていません。
Dyna Roboticsは、ロボット操作のために設計されたワールドアクションモデルであるDyna-2を発表しました。このモデルは、100万時間以上の一人称視点の人間ビデオ、つまり約170年分の連続した覚醒経験に相当するデータで事前学習されています。このモデルは、ビデオとアクションのトークン化と処理を分離したトランスフォーマーの混合を使用し、フローマッチングを用いたビデオ拡散バックボーンを採用しています。同社は、3つの重要なスケーリング結果を報告しています。すなわち、スケーリング則が最大100万時間の人間データに当てはまること、この法則が39のタスクにわたる未見のロボットデータにゼロショットで転移すること、そしてビデオ予測(アクションデータではなく)がクロスエンボディメントの汎化を促進することです。3つのエンボディメントにわたる14のタスクでのロボット上でのポストトレーニングでは、データラダー全体で平均正規化スコアが20%から53%に増加し、特にLockbox Key Turningでは成功率が90%に達しました。Dyna-2はダウンロード可能な重みとしては提供されておらず、展開にはDynaロボットセルを購入する必要があります。このモデルは、同社の本番用VLAであるDyna-1を、ロボット上でのテストと未見の顧客サイトの両方で上回り、本番基準を87%の確率で通過しました(Dyna-1では46%)。技術レポートはさらに詳細な情報を提供しています。
出典: MarkTechPost —
原文
