لماذا تواجه الروبوتات الشبيهة بالبشر صعوبة في إمساك الأجسام المتحركة: تطوير VLA للبيئات الديناميكية
Unitree Robotics
تعمل نماذج VLA الحديثة بشكل جيد في المشاهد الثابتة ولكنها تفشل عندما تتحرك الأجسام، مثل على سير ناقل. المشكلات الرئيسية هي زمن الاستجابة، وأجزاء الإجراءات القديمة، ونقص السياق الزمني. يعمل الباحثون الآن على تطوير VLA ديناميكي لكامل الجسم للتعامل مع الأجسام المتحركة والحفاظ على التوازن.
معظم عروض الروبوتات اليوم تتم في بيئات ثابتة مع إضاءة مستقرة وكاميرات مثبتة، حيث تؤدي نماذج الرؤية واللغة والحركة (Vision-Language-Action أو VLA) أداءً جيدًا. ومع ذلك، غالبًا ما تتضمن المهام في العالم الحقيقي أجسامًا متحركة، مثل العناصر على حزام ناقل. عندما يتفاعل روبوت بشري بالحجم الطبيعي مع الأجسام المتحركة، يجب عليه أيضًا المشي والحفاظ على التوازن، مما يعقد حسابات الحركة. تشمل التحديات الرئيسية التأخير بين الملاحظة والفعل، وأجزاء الحركة القديمة، وعدم القدرة على تحديد سرعة الجسم من صورة واحدة. تعالج النماذج الحديثة مثل "ديناميك في إل إيه" (DynamicVLA) هذه المشكلات عن طريق تحديث الإجراءات بشكل متكرر ومراعاة التوقيت. بالنسبة للروبوتات البشرية، فإن التحكم في الجسم بالكامل ضروري لأن حركات الذراع تؤثر على توازن الجذع. تعالج بنية "آر إل دي إكس-1" (RLDX-1) تدفقات متعددة للمعلومات (الحركة، الذاكرة، الفيزياء، الفعل) لتحسين المناولة الديناميكية. في خدمات ويب أم تي إس (MTS Web Services)، يقوم المؤلف بتكييف بنية "آر إل دي إكس-1" للتحكم في الروبوت البشري "يونيتري جي1" (Unitree G1) من أجل الإمساك الديناميكي الكامل للجسم لعناصر الناقل، مع معالجة المهمة كحلقة مغلقة: ملاحظة، تنبؤ، اعتراض، تنفيذ، تحقق، تصحيح.
المصدر: Habr — хаб ИИ —
الأصلي
