LeRobot v0.6.0:基于世界模型的策略、新VLA、基准测试与评估CLI
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 已发布,支持三种基于世界模型的策略(VLA-JEPA、FastWAM、LingBot-VA),新的VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型API(Robometer、TOP Reward)。新增六个模拟基准测试,并集成到 lerobot-eval 中,同时提供 CLI lerobot-rollout,支持DAgger修正、深度信息、自动语言注释,数据加载速度提升高达2倍。
LeRobot v0.6.0 引入了三种稳定的模型策略:VLA-JEPA(在潜在空间中预测未来,推理时无额外开销)、LingBot-VA(自回归视频与动作预测,支持保存预测视频)以及 FastWAM(50亿参数视频生成器,推理时绕过“梦境”阶段)。VLA 模型家族得到扩展:GR00T N1.7(NVIDIA,基于 Cosmos-Reason2-2B 与流匹配技术)、MolmoAct2(艾伦人工智能研究所,支持完整训练与部署流程,推理时约占用 12 GB 内存,LoRA 微调需 24 GB)、EO-1(基于 Qwen2.5-VL-3B 与流匹配技术)、Multitask DiT(4.5亿参数,以 CLIP 为条件)、EVO1(7.7亿参数,基于 InternVL3-1B)。针对奖励模型引入了统一应用程序编程接口:Robometer(基于 Qwen3-VL-4B,预训练通用模型,评估进度与成功)与 TOPReward(零样本设置,使用“True”标记的对数概率)。新增六个仿真基准测试:LIBERO-plus(10000 个扰动变体)、RoboTwin 2.0(SAPIEN 平台上 50 个任务,含领域随机化)、RoboCasa365(2500 个厨房中的 365 个任务)、RoboCerebra(长时程任务,3-6 个子目标)、RoboMME(记忆测试)、VLABench(知识与推理)。所有基准测试均可通过统一命令行界面 lerobot-eval 运行。命令行界面 lerobot-rollout 包含多种策略:sentry(连续录制并滚动)、highlight(环形缓冲区)、episodic(经典录制)以及 dagger(含干预标志的人工修正)。数据集方面:支持任意编解码器的视频编码(包括硬件加速的 NVENC、VideoToolbox、VAAPI、QSV),支持来自英特尔实感深度相机的深度数据,通过视觉大模型实现自动语言注释(lerobot-annotate),通过并行解码与紧凑型 uint8 帧实现高达 2 倍的数据加载加速。支持完全分片数据并行训练以及在 Hugging Face Jobs 上的云端训练。
来源: Hugging Face blog —
原文
