Гуманоидный робот на конвейере: как VLA учат работать в динамической среде
ML-инженер MTC Web Services рассказывает, почему гуманоиду сложнее брать движущиеся предметы, чем неподвижные, и как архитектура VLA (Vision-Language-Action) адаптируется для работы на конвейере. Основные проблемы — задержки между наблюдением и действием, устаревание последовательностей команд и необходимость целостного управления телом (whole-body control).
Дания, ML-инженер MTC Web Services, описывает вызовы при обучении гуманоидного робота работе в динамической среде, в частности на конвейере. Большинство VLA-моделей, таких как RT-2, демонстрируют успехи в статических условиях, но на движущихся объектах возникают три ключевые проблемы: задержка между получением изображения и действием, устаревание action chunk'ов (заранее рассчитанных последовательностей движений), а также недостаток информации при обработке одного кадра — робот не может оценить скорость и направление движения объекта. Для гуманоида задача усложняется необходимостью поддерживать баланс и согласовывать движения всего тела (whole-body control), тогда как стационарные манипуляторы могут корректировать только руку. Современные VLA развиваются в четырёх направлениях: учёт временного контекста (анализ последовательности кадров), более частое обновление действий (замкнутый цикл), интеграция физических сигналов (данные о суставах, тактильные ощущения) и использование симуляции для переноса навыков в реальность. В качестве примера рассматривается архитектура RLDX-1, которая обрабатывает несколько типов данных (визуальные, физические и action-сигналы) через Multi-Stream Action Transformer. Однако RLDX-1 не учитывает баланс корпуса и работает только с руками. В RnD MWS разрабатывают версию whole-body dynamic VLA на базе робота Unitree G1, чтобы научить его перехватывать детали на конвейере с учётом движения всего тела.
Источник: Habr — хаб ИИ —
оригинал
