ヒューマノイドが動く物体を掴むのに苦戦する理由:動的環境向けVLAの開発
Unitree Robotics
現代のVLAモデルは静的なシーンではうまく機能するが、コンベア上など物体が移動する場合には失敗する。主な問題は、レイテンシ、古くなったアクションチャンク、時間的文脈の欠如である。研究者たちは現在、動く物体を扱いバランスを保つための全身動的VLAを開発している。
現在のロボットデモの多くは、照明が安定しカメラが固定された静的環境で行われ、VLA(Vision-Language-Action)モデルはそのような環境で良好に機能します。しかし現実世界のタスクでは、コンベアベルト上の物品など、動く物体がしばしば関与します。フルサイズのヒューマノイドロボットが動く物体と相互作用する際には、歩行とバランス維持も求められ、動作計算が複雑化します。主な課題として、観測と行動間のレイテンシ、時代遅れのアクションチャンク、単一画像から物体の速度を判断できないことなどが挙げられます。最近のDynamicVLAのようなモデルは、アクションの更新頻度を高め、タイミングを考慮することでこれらの問題に対処します。ヒューマノイドでは、腕の動きが胴体のバランスに影響するため、全身制御が不可欠です。RLDX-1アーキテクチャは、複数の情報ストリーム(動作、記憶、物理、行動)を処理し、動的マニピュレーションを向上させます。MTS Web Servicesにおいて、筆者はRLDX-1をUnitree G1ヒューマノイドに適用し、コンベア上の物品を全身で動的に掴むタスクを閉ループ(観測→予測→迎撃→実行→検証→補正)として適応させています。
出典: Habr — хаб ИИ —
原文
