LeRobot v0.6.0: Weltmodell-basierte Policies, neue VLA, Benchmarks und CLI für Evaluation
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 wurde veröffentlicht mit Unterstützung für drei weltmodell-basierte Policies (VLA-JEPA, FastWAM, LingBot-VA), neuen VLA (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) und einer einheitlichen API für Belohnungsmodelle (Robometer, TOPReward). Sechs neue Simulations-Benchmarks wurden hinzugefügt und in lerobot-eval integriert, eine CLI lerobot-rollout mit DAgger-Korrekturen, Tiefenunterstützung, automatischer Sprachannotation und bis zu 2-facher Datenladebeschleunigung.
LeRobot v0.6.0 führt drei neue friedliche Modell-Policies ein: VLA-JEPA (Zukunftsprognose im latenten Raum ohne Inferenzkosten), LingBot-VA (autoregressive Video- und Aktionsvorhersage mit Möglichkeit zum Speichern von vorhergesagten Videos), FastWAM (5 Milliarden Parameter starker Video-Generator, der das "Träumen" während der Inferenz umgeht). Der VLA-Zoo wurde erweitert: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B mit Flow-Matching), MolmoAct2 (Allen Institute for AI, Unterstützung für den vollständigen Trainings- und Bereitstellungszyklus, ~12 GB bei Inferenz, 24 GB für LoRA), EO-1 (Qwen2.5-VL-3B mit Flow-Matching), Multitask DiT (450 Millionen Parameter, konditioniert auf CLIP), EVO1 (0,77 Milliarden Parameter, InternVL3-1B). Eine einheitliche API für Belohnungsmodelle wurde eingeführt: Robometer (Qwen3-VL-4B, vortrainiertes allgemeines Modell, bewertet Fortschritt und Erfolg) und TOPReward (Zero-Shot-Setup, verwendet die Log-Wahrscheinlichkeit des "True"-Tokens). Sechs neue Simulationsbenchmarks: LIBERO-plus (10.000 perturbierte Varianten), RoboTwin 2.0 (50 Aufgaben auf SAPIEN mit Domänenrandomisierung), RoboCasa365 (365 Aufgaben in 2.500 Küchen), RoboCerebra (lange Horizonte, 3–6 Teilziele), RoboMME (Gedächtnistests), VLABench (Wissen und logisches Denken). Alle Benchmarks können über die einheitliche CLI `lerobot-eval` ausgeführt werden. Die CLI `lerobot-rollout` umfasst Strategien: Sentry (kontinuierliche Aufzeichnung mit Rotation), Highlight (Ringpuffer), Episodic (klassische Aufzeichnung) und Dagger (menschliche Korrekturen mit Interventionsflag). Bei Datensätzen: Videokodierung mit beliebigem Codec (einschließlich hardwarebeschleunigtem NVENC, VideoToolbox, VAAPI, QSV), Unterstützung für Tiefendaten von Intel RealSense, automatische Sprachannotation per VLM (`lerobot-annotate`), bis zu 2-fache Beschleunigung der Datenladung durch parallele Dekodierung und kompakte uint8-Frames. FSDP-Training und Cloud-Training auf HF Jobs.
Quelle: Hugging Face blog —
Original
