LeRobot v0.6.0: 세계 모델 기반 정책, 새로운 VLA, 벤치마크 및 평가용 CLI 출시
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0이 출시되어 세 가지 세계 모델 기반 정책(VLA-JEPA, FastWAM, LingBot-VA), 새로운 VLA(GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT)를 지원하며, 보상 모델(Robometer, TOPReward)을 위한 통합 API를 제공합니다. 6개의 새로운 시뮬레이션 벤치마크가 추가되었고, lerobot-eval, DAgger 보정 기능이 있는 CLI lerobot-rollout, 깊이 지원, 자동 언어 주석, 최대 2배 데이터 로딩 속도 향상이 통합되었습니다.
LeRobot v0.6.0은 세 가지 혁신적인 모델 정책을 도입했습니다: VLA-JEPA(추론 비용 없이 잠재 공간에서 미래를 예측), LingBot-VA(자기회귀적 비디오 및 행동 예측, 예측된 비디오 저장 가능), FastWAM(50억 개의 파라미터를 가진 비디오 생성기, 추론 시 '꿈꾸기' 과정 생략). VLA 동물원이 확장되었습니다: GR00T N1.7(NVIDIA, Cosmos-Reason2-2B와 flow-matching 결합), MolmoAct2(Allen Institute for AI, 전체 훈련 및 배포 주기 지원, 추론 시 약 12GB, LoRA 시 24GB), EO-1(Qwen2.5-VL-3B와 flow-matching), Multitask DiT(4억 5천만 개의 파라미터, CLIP에 조건화), EVO1(7억 7천만 개의 파라미터, InternVL3-1B). 보상 모델을 위한 통합 API가 도입되었습니다: Robometer(Qwen3-VL-4B, 사전 훈련된 범용 모델, 진행 상황 및 성공 평가)와 TOPReward(제로샷 설정, 'True' 토큰의 로그 확률 사용). 6개의 새로운 시뮬레이션 벤치마크: LIBERO-plus(10,000개의 변형 변종), RoboTwin 2.0(SAPIEN에서 50개 태스크, 도메인 무작위화 적용), RoboCasa365(2,500개 주방에 걸친 365개 태스크), RoboCerebra(긴 시간 지평, 3~6개의 하위 목표), RoboMME(메모리 테스트), VLABench(지식 및 추론). 모든 벤치마크는 통합 CLI인 lerobot-eval을 통해 실행할 수 있습니다. CLI lerobot-rollout에는 다음 전략이 포함됩니다: sentry(연속 녹화, 순환), highlight(링 버퍼), episodic(전통적 녹화), dagger(중재 플래그를 통한 인간 교정). 데이터셋 기능: 임의 코덱을 사용한 비디오 인코딩(하드웨어 NVENC, VideoToolbox, VAAPI, QSV 포함), Intel RealSense의 깊이 정보 지원, VLM을 통한 자동 언어 주석(lerobot-annotate), 병렬 디코딩 및 압축된 uint8 프레임을 통한 최대 2배 데이터 로딩 속도 향상. FSDP 훈련 및 HF Jobs에서의 클라우드 훈련이 지원됩니다.
출처: Hugging Face blog —
원문
