Почему гуманоиды с трудом хватают движущиеся объекты: разработка VLA для динамических сред
Unitree Robotics
Современные модели VLA (Vision-Language-Action — зрение-язык-действие) хорошо работают в статичных сценах, но дают сбой, когда объекты движутся, например, на конвейере. Основные проблемы — задержка, устаревшие блоки действий и отсутствие временного контекста. Исследователи сейчас разрабатывают динамические VLA для всего тела, чтобы работать с движущимися объектами и сохранять равновесие.
В настоящее время большинство демонстраций роботов проводятся в статичных условиях с постоянным освещением и неподвижными камерами, где модели VLA (Vision-Language-Action, визуально-языковые модели действий) показывают хорошие результаты. Однако реальные задачи часто связаны с движущимися объектами, например, предметами на конвейерной ленте. Когда полноразмерный гуманоидный робот взаимодействует
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
