LeRobot v0.6.0: Políticas Basadas en Modelos del Mundo, Nuevo VLA, Benchmarks y CLI para Evaluación
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
Se ha lanzado LeRobot v0.6.0 con soporte para tres políticas basadas en modelos del mundo (VLA-JEPA, FastWAM, LingBot-VA), nuevo VLA (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) y una API unificada para modelos de recompensa (Robometer, TOPReward). Se han añadido seis nuevos benchmarks de simulación integrados en lerobot-eval, un CLI lerobot-rollout con correcciones DAgger, soporte de profundidad, anotación automática de lenguaje y hasta 2x de aceleración en la carga de datos.
LeRobot v0.6.0 introduce tres políticas de modelo pacíficas: VLA-JEPA (predicción futura en espacio latente sin coste de inferencia), LingBot-VA (predicción autorregresiva de video y acciones con capacidad de guardar videos predichos) y FastWAM (generador de video de 5 mil millones de parámetros, que evita "soñar" en inferencia). El zoológico VLA se ha ampliado: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B con flow-matching), MolmoAct2 (Allen Institute for AI, soporte para el ciclo completo de entrenamiento y despliegue, ~12 GB en inferencia, 24 GB para LoRA), EO-1 (Qwen2.5-VL-3B con flow-matching), Multitask DiT (450 millones de parámetros, condicionado en CLIP) y EVO1 (0,77 mil millones de parámetros, InternVL3-1B). Se ha introducido una API unificada para modelos de recompensa: Robometer (Qwen3-VL-4B, modelo general preentrenado, evalúa progreso y éxito) y TOPReward (configuración zero-shot, utiliza la log-probabilidad del token "True"). Seis nuevos benchmarks de simulación: LIBERO-plus (10,000 variantes perturbadas), RoboTwin 2.0 (50 tareas en SAPIEN con aleatorización de dominio), RoboCasa365 (365 tareas en 2,500 cocinas), RoboCerebra (horizontes largos, 3-6 subobjetivos), RoboMME (pruebas de memoria) y VLABench (conocimiento y razonamiento). Todos los benchmarks se pueden ejecutar mediante la CLI unificada lerobot-eval. La CLI lerobot-rollout incluye estrategias: sentry (grabación continua con rotación), highlight (búfer circular), episodic (grabación clásica) y dagger (correcciones humanas con indicador de intervención). En los conjuntos de datos: codificación de video con cualquier codec (incluyendo NVENC de hardware, VideoToolbox, VAAPI, QSV), soporte para profundidad de Intel RealSense, anotación automática de lenguaje mediante VLM (lerobot-annotate), hasta 2x de aceleración en carga de datos mediante decodificación paralela y tramas uint8 compactas. Entrenamiento FSDP y entrenamiento en la nube en HF Jobs.
Fuente: Hugging Face blog —
original
