로보틱스연구 🇷🇺 24.07.2026 05:03

Why It's Hard for a Humanoid to Grasp Moving Objects: Developing VLA for Dynamic Environments

Unitree RoboticsUnitree Robotics
ML engineer Daniya from MTC Web Services discusses the challenges VLA models face when dealing with moving objects, and how the company's R&D unit adapts the RLDX-1 architecture for the Unitree G1 humanoid to pick parts from a conveyor belt while maintaining balance.
ML-инженер MTC Web Services Дания объясняет, почему гуманоидным роботам сложно работать в динамической среде, например, когда объекты движутся по конвейеру. В статических условиях современные VLA (Vision-Language-Action) модели показывают высокое качество управления, но в динамике возникают три основные проблемы: задержка между наблюдением и действием (изображение с камеры, обработка, отправка команды занимают десятки миллисекунд, за которые объект смещается), устаревание заранее рассчитанных последовательностей действий (action chunk), и недостаток информации при анализе одного кадра (нельзя определить скорость и направление движения). Для решения этих проблем модели переходят к анализу последовательностей кадров, непрерывному обновлению действий и учёту физических сигналов (положение суставов, тактильные данные). Гуманоид сложнее стационарного манипулятора, так как движение руки влияет на баланс корпуса; требуется whole-body control, согласующий движения рук, корпуса и ног. В RnD MWS разрабатывают whole-body dynamic VLA на основе архитектуры RLDX-1, которая обрабатывает несколько потоков информации (движение, контекст, физику, действия) и работает с гуманоидом Unitree G1. Задача — научить робота захватывать детали на конвейере, предсказывая их траекторию, синхронизируя движения и сохраняя равновесие.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스