LeRobot v0.6.0: Kebijakan Berbasis Model Dunia, VLA Baru, Tolok Ukur, dan CLI untuk Evaluasi
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 telah dirilis dengan dukungan untuk tiga kebijakan berbasis model dunia (VLA-JEPA, FastWAM, LingBot-VA), VLA baru (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) dan API terpadu untuk model hadiah (Robometer, TOPReward). Enam tolok ukur simulasi baru telah ditambahkan dan diintegrasikan ke dalam lerobot-eval, sebuah CLI lerobot-rollout dengan koreksi DAgger, dukungan kedalaman, anotasi bahasa otomatis, dan percepatan pemuatan data hingga 2x.
LeRobot v0.6.0 memperkenalkan tiga model kebijakan yang damai: VLA-JEPA (prediksi masa depan dalam ruang laten tanpa biaya inferensi), LingBot-VA (prediksi video dan aksi secara autoregresif dengan kemampuan menyimpan video prediksi), FastWAM (generator video dengan 5 miliar parameter, melewati "melamun" saat inferensi). Kebun binatang VLA telah diperluas: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B dengan flow-matching), MolmoAct2 (Allen Institute for AI, mendukung siklus pelatihan dan penerapan penuh, ~12 GB saat inferensi, 24 GB untuk LoRA), EO-1 (Qwen2.5-VL-3B dengan flow-matching), Multitask DiT (450 juta parameter, dikondisikan pada CLIP), EVO1 (0,77 miliar parameter, InternVL3-1B). API terpadu telah diperkenalkan untuk model reward: Robometer (Qwen3-VL-4B, model umum yang sudah dilatih, mengevaluasi kemajuan dan keberhasilan) dan TOPReward (pengaturan zero-shot, menggunakan log-probabilitas token "True"). Enam tolok ukur simulasi baru: LIBERO-plus (10.000 varian yang diubah), RoboTwin 2.0 (50 tugas pada SAPIEN dengan randomisasi domain), RoboCasa365 (365 tugas di 2.500 dapur), RoboCerebra (cakrawala panjang, 3–6 sub-tujuan), RoboMME (tes memori), VLABench (pengetahuan dan penalaran). Semua tolok ukur dapat dijalankan melalui CLI terpadu lerobot-eval. CLI lerobot-rollout mencakup strategi: sentry (perekaman terus-menerus dengan rotasi), highlight (ring buffer), episodic (perekaman klasik), dan dagger (koreksi manusia dengan flag intervensi). Dalam set data: pengkodean video dengan kodek apa pun (termasuk NVENC perangkat keras, VideoToolbox, VAAPI, QSV), dukungan untuk depth dari Intel RealSense, anotasi bahasa otomatis melalui VLM (lerobot-annotate), percepatan pemuatan data hingga 2x melalui decoding paralel dan frame uint8 yang ringkas. Pelatihan FSDP dan pelatihan cloud di HF Jobs.
Sumber: Hugging Face blog —
asli
