人形机器人抓取移动物体为何困难:为动态环境开发VLA
Unitree Robotics
MTC Web Services的机器学习工程师Daniya讨论了VLA模型在处理移动物体时面临的挑战,以及公司研发部门如何调整RLDX-1架构,使Unitree G1人形机器人能从传送带上抓取零件并保持平衡。
MTC Web Services的机器学习工程师丹妮亚解释了为什么人形机器人在动态环境中难以工作,例如当物体在传送带上移动时。在静态条件下,现代的VLA(视觉-语言-动作)模型表现出较高的控制质量,但在动态环境中主要存在三个问题:观察与动作之间的延迟(从摄像头获取图像、处理、发送指令需要几十毫秒,在此期间物体会移动)、预先计算的动作序列(action chunk)过时,以及分析单帧图像时信息不足(无法确定速度和运动方向)。为解决这些问题,模型转向分析帧序列、持续更新动作并考虑物理信号(关节位置、触觉数据)。人形机器人比固定机械臂更复杂,因为手臂的运动会影响身体平衡;需要全身控制来协调手臂、躯干和腿部运动。在MWS的研发部门,他们基于RLDX-1架构开发全身动态VLA,该架构处理多流信息(运动、上下文、物理、动作),并与Unitree G1人形机器人配合工作。目标是教机器人抓取传送带上的零件,预测其轨迹、同步运动并保持平衡。
来源: Habr — хаб ИИ —
原文
