LeRobot v0.6.0 : Politiques basées sur un modèle du monde, nouveau VLA, benchmarks et CLI pour l'évaluation
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 est sorti avec le support de trois politiques basées sur un modèle du monde (VLA-JEPA, FastWAM, LingBot-VA), de nouveaux VLA (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) et une API unifiée pour les modèles de récompense (Robometer, TOPReward). Six nouveaux benchmarks de simulation ont été ajoutés et intégrés dans lerobot-eval, un CLI lerobot-rollout avec corrections DAgger, support de la profondeur, annotation automatique du langage, et jusqu'à 2 fois plus de rapidité de chargement des données.
LeRobot v0.6.0 introduit trois politiques de modèle pacifiques : VLA-JEPA (prédiction future dans l'espace latent sans coût d'inférence), LingBot-VA (prédiction autorégressive de vidéo et d'action avec la capacité de sauvegarder les vidéos prédites), FastWAM (générateur de vidéo de 5 milliards de paramètres, contournant le « rêve » lors de l'inférence). Le zoo VLA a été élargi : GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B avec flow-matching), MolmoAct2 (Allen Institute for AI, support pour le cycle complet d'entraînement et de déploiement, environ 12 Go à l'inférence, 24 Go pour LoRA), EO-1 (Qwen2.5-VL-3B avec flow-matching), Multitask DiT (450 millions de paramètres, conditionné sur CLIP), EVO1 (0,77 milliard de paramètres, InternVL3-1B). Une API unifiée a été introduite pour les modèles de récompense : Robometer (Qwen3-VL-4B, modèle général pré-entraîné, évalue la progression et le succès) et TOPReward (configuration zero-shot, utilise la log-probabilité du token « Vrai »). Six nouveaux benchmarks de simulation : LIBERO-plus (10 000 variantes perturbées), RoboTwin 2.0 (50 tâches sur SAPIEN avec randomisation du domaine), RoboCasa365 (365 tâches dans 2 500 cuisines), RoboCerebra (longs horizons, 3 à 6 sous-objectifs), RoboMME (tests de mémoire), VLABench (connaissances et raisonnement). Tous les benchmarks peuvent être exécutés via l'interface en ligne de commande unifiée `lerobot-eval`. L'interface en ligne de commande `lerobot-rollout` inclut des stratégies : sentry (enregistrement continu avec rotation), highlight (tampon circulaire), episodic (enregistrement classique) et dagger (corrections humaines avec indicateur d'intervention). Dans les jeux de données : encodage vidéo avec n'importe quel codec (y compris NVENC matériel, VideoToolbox, VAAPI, QSV), support de la profondeur depuis Intel RealSense, annotation automatique du langage via VLM (`lerobot-annotate`), accélération jusqu'à 2x du chargement des données grâce au décodage parallèle et aux trames uint8 compactes. Entraînement FSDP et entraînement dans le cloud sur HF Jobs.
Source: Hugging Face blog —
original
