LeRobot v0.6.0: Maailmamallipohjaiset politiikat, uusi VLA, vertailuarvot ja komentorivityökalu arviointiin
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 on julkaistu. Se tukee kolmea maailmamallipohjaista politiikkaa (VLA-JEPA, FastWAM, LingBot-VA), uutta VLA:ta (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) ja yhtenäistä rajapintaa palkkiomalleille (Robometer, TOPReward). Kuusi uutta simulaatiovertailuarvoa on lisätty ja integroitu lerobot-eval-työkaluun. Lisäksi mukana on CLI-työkalu lerobot-rollout DAgger-korjauksilla, syvyystuki, automaattinen kielimerkintä ja jopa 2x tiedonlatausnopeuden parannus.
LeRobot v0.6.0 esittelee kolme rauhanomaista mallipolitiikkaa: VLA-JEPA (tulevaisuuden ennustaminen latenttiavaruudessa ilman päättelykustannusta), LingBot-VA (autoregressiivinen videon ja toimintojen ennustus mahdollisuudella tallentaa ennustettuja videoita), FastWAM (5 miljardin parametrin videogeneraattori, joka ohittaa "unelmoinnin" päättelyssä). VLA-eläintarhaa on laajennettu: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B virtausyhteensovituksella), MolmoAct2 (Allen Institute for AI, täyden koulutus- ja käyttöönottosyklin tuki, noin 12 gigatavua päättelyssä, 24 gigatavua LoRA:lle), EO-1 (Qwen2.5-VL-3B virtausyhteensovituksella), Multitask DiT (450 miljoonaa parametria, ehdollistettu CLIP:iin), EVO1 (0,77 miljardia parametria, InternVL3-1B). Palkintomalleille on otettu käyttöön yhtenäinen rajapinta: Robometer (Qwen3-VL-4B, esikoulutettu yleismalli, arvioi edistymistä ja onnistumista) ja TOPReward (nollakoeasetelma, käyttää "Tosi"-tokenin log-todennäköisyyttä). Kuusi uutta simulaatiotestiympäristöä: LIBERO-plus (10 000 vaihdeltua varianttia), RoboTwin 2.0 (50 tehtävää SAPIENissa verkkotunnusten satunnaistuksella), RoboCasa365 (365 tehtävää 2 500 keittiössä), RoboCerebra (pitkä aikahorisontti, 3–6 alatavoitetta), RoboMME (muistitestit), VLABench (tieto ja päättely). Kaikkia testiympäristöjä voidaan ajaa yhtenäisen CLI:n lerobot-eval kautta. CLI lerobot-rollout sisältää strategiat: sentry (jatkuva tallennus kiertovaihdolla), highlight (rengaspuskuri), episodic (klassinen tallennus) ja dagger (ihmisen korjaukset interventiolipulla). Tietojoukoissa: videon koodaus millä tahansa koodekilla (mukaan lukien laitteisto NVENC, VideoToolbox, VAAPI, QSV), tuki Intel RealSensen syvyydelle, automaattinen kielellinen annotointi VLM:n kautta (lerobot-annotate), jopa 2-kertainen tiedonlatausnopeutus rinnakkaisen dekoodauksen ja kompaktien uint8-kehysten avulla. FSDP-koulutus ja pilvikoulutus HF Jobsissa.
Lähde: Hugging Face blog —
Alkuperäinen
