لماذا يصعب على الإنسان الآلي الإمساك بالأجسام المتحركة: تطوير نموذج VLA للبيئات الديناميكية
Unitree Robotics
تتحدث مهندسة التعلم الآلي دانيا من شركة MTC Web Services عن التحديات التي تواجه نماذج VLA عند التعامل مع الأجسام المتحركة، وكيف تقوم وحدة البحث والتطوير في الشركة بتكييف بنية RLDX-1 مع الإنسان الآلي Unitree G1 لالتقاط أجزاء من سير ناقل مع الحفاظ على التوازن.
Дания, ML-инженер MTC Web Services, объясняет, почему гуманоидным роботам сложно работать в динамической среде, например, когда объекты движутся по конвейеру. В статических условиях современные модели VLA (Vision-Language-Action, зрение-язык-действие) демонстрируют высокое качество управления, но в динамике возникают три основные проблемы: задержка между наблюдением и действием (изображение с камеры, его обработка и отправка команды занимают десятки миллисекунд, за которые объект смещается), устаревание заранее рассчитанных последовательностей действий (action chunk) и недостаток информации при анализе одного кадра (невозможно определить скорость и направление движения). Для решения этих проблем модели переходят к анализу последовательностей кадров, непрерывному обновлению действий и учёту физических сигналов (положение суставов, тактильные данные). Гуманоид сложнее стационарного манипулятора, так как движение руки влияет на баланс корпуса; требуется управление всем телом (whole-body control), согласующее движения рук, корпуса и ног. В RnD MWS разрабатывают whole-body dynamic VLA на основе архитектуры RLDX-1, которая обрабатывает несколько потоков информации (движение, контекст, физику, действия) и работает с гуманоидом Unitree G1. Задача — научить робота захватывать детали на конвейере, предсказывая их траекторию, синхронизируя движения и сохраняя равновесие.
المصدر: Habr — хаб ИИ —
الأصلي
