LeRobot v0.6.0: विश्व मॉडल-आधारित नीतियाँ, नया VLA, बेंचमार्क और मूल्यांकन के लिए CLI
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 जारी किया गया है जिसमें तीन विश्व मॉडल-आधारित नीतियों (VLA-JEPA, FastWAM, LingBot-VA), नए VLA (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) और पुरस्कार मॉडलों के लिए एक एकीकृत API (Robometer, TOPReward) का समर्थन शामिल है। छह नए सिमुलेशन बेंचमार्क जोड़े गए हैं और इन्हें lerobot-eval, DAgger सुधारों के साथ एक CLI lerobot-rollout, गहराई समर्थन, स्वचालित भाषा एनोटेशन, और 2x तक डेटा लोडिंग गति में एकीकृत किया गया है।
LeRobot v0.6.0 तीन शांतिपूर्ण मॉडल नीतियां प्रस्तुत करता है: VLA-JEPA (अनुमान लागत के बिना अव्यक्त स्थान में भविष्य की भविष्यवाणी), LingBot-VA (पूर्वानुमानित वीडियो सहेजने की क्षमता के साथ स्वप्रतिगामी वीडियो और क्रिया भविष्यवाणी), FastWAM (5 अरब पैरामीटर वीडियो जनरेटर, अनुमान पर 'स्वप्न' से बचता है)। VLA ज़ू का विस्तार किया गया है: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B फ्लो-मैचिंग के साथ), MolmoAct2 (Allen Institute for AI, पूर्ण प्रशिक्षण और तैनाती चक्र के लिए समर्थन, अनुमान पर ~12 GB, LoRA के लिए 24 GB), EO-1 (Qwen2.5-VL-3B फ्लो-मैचिंग के साथ), Multitask DiT (450M पैरामीटर, CLIP पर सशर्त), EVO1 (0.77 अरब पैरामीटर, InternVL3-1B)। पुरस्कार मॉडल के लिए एक एकीकृत API प्रस्तुत किया गया है: Robometer (Qwen3-VL-4B, पूर्व-प्रशिक्षित सामान्य मॉडल, प्रगति और सफलता का मूल्यांकन) और TOPReward (शून्य-शॉट सेटअप, 'True' टोकन की लॉग-प्रायिकता का उपयोग करता है)। छह नए सिमुलेशन बेंचमार्क: LIBERO-plus (10,000 विचलित प्रकार), RoboTwin 2.0 (SAPIEN पर डोमेन रैंडमाइज़ेशन के साथ 50 कार्य), RoboCasa365 (2,500 रसोई में 365 कार्य), RoboCerebra (लंबे क्षितिज, 3–6 उपलक्ष्य), RoboMME (स्मृति परीक्षण), VLABench (ज्ञान और तर्क)। सभी बेंचमार्क एकीकृत CLI lerobot-eval के माध्यम से चलाए जा सकते हैं। CLI lerobot-rollout में रणनीतियाँ शामिल हैं: sentry (रोटेशन के साथ सतत रिकॉर्डिंग), highlight (रिंग बफर), episodic (शास्त्रीय रिकॉर्डिंग), और dagger (हस्तक्षेप ध्वज के साथ मानव सुधार)। डेटासेट में: किसी भी कोडेक के साथ वीडियो एन्कोडिंग (हार्डवेयर NVENC, VideoToolbox, VAAPI, QSV सहित), Intel RealSense से गहराई के लिए समर्थन, VLM के माध्यम से स्वचालित भाषा एनोटेशन (lerobot-annotate), समानांतर डिकोडिंग और कॉम्पैक्ट uint8 फ्रेम के माध्यम से 2 गुना तक डेटा लोडिंग गति वृद्धि। FSDP प्रशिक्षण और HF Jobs पर क्लाउड प्रशिक्षण।
स्रोत: Hugging Face blog —
मूल
