ロボティクス研究 🇷🇺 24.07.2026 05:03

Why It's Hard for a Humanoid to Grasp Moving Objects: Developing VLA for Dynamic Environments

Unitree RoboticsUnitree Robotics
ML engineer Daniya from MTC Web Services discusses the challenges VLA models face when dealing with moving objects, and how the company's R&D unit adapts the RLDX-1 architecture for the Unitree G1 humanoid to pick parts from a conveyor belt while maintaining balance.
MTC Web ServicesのMLエンジニアであるダニア氏は、人型ロボットがコンベア上を移動する物体など、動的な環境で動作するのがなぜ難しいのかを説明しています。静的な条件下では、最新のVLA(Vision-Language-Action、視覚・言語・行動)モデルは高い制御品質を示しますが、動的な環境では主に3つの問題が発生します。まず、観測から行動までの遅延(カメラ画像の取得、処理、コマンド送信に数十ミリ秒かかり、その間に物体が移動する)や、事前に計算された行動チャンク(一連の行動のまとまり)の陳腐化、そして単一フレームの解析では情報が不足する(速度や移動方向が判定できない)という問題です。これらの問題を解決するために、モデルはフレームシーケンスの解析、行動の継続的な更新、物理信号(関節位置、触覚データ)の考慮へと移行しています。人型ロボットは固定式マニピュレータよりも複雑で、腕の動きが胴体のバランスに影響を与えるため、腕、胴体、脚の動きを調整する全身制御(whole-body control)が必要です。MWSの研究開発部門では、RLDX-1アーキテクチャに基づく全身動的VLAモデルを開発しており、複数の情報ストリーム(動き、コンテキスト、物理、行動)を処理し、Unitree G1人型ロボットで動作しています。目標は、ロボットにコンベア上の部品を把持させることであり、その軌道を予測し、動きを同期させ、バランスを保つことを学習させます。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース