LeRobot v0.6.0: Chính sách dựa trên mô hình thế giới, VLA mới, chuẩn đánh giá và CLI cho đánh giá
Hugging Face
NVIDIA
Allen Institute for AI
Alibaba/Qwen
LeRobot v0.6.0 đã được phát hành với hỗ trợ cho ba chính sách dựa trên mô hình thế giới (VLA-JEPA, FastWAM, LingBot-VA), VLA mới (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) và một API thống nhất cho các mô hình phần thưởng (Robometer, TOPReward). Sáu chuẩn đánh giá mô phỏng mới đã được thêm vào và tích hợp vào lerobot-eval, một CLI lerobot-rollout với các hiệu chỉnh DAgger, hỗ trợ độ sâu, chú thích ngôn ngữ tự động và tăng tốc tải dữ liệu lên đến 2 lần.
LeRobot v0.6.0 giới thiệu ba chính sách mô hình hòa bình: VLA-JEPA (dự đoán tương lai trong không gian tiềm ẩn mà không tốn chi phí suy luận), LingBot-VA (dự đoán video và hành động tự hồi quy với khả năng lưu video dự đoán), FastWAM (bộ tạo video 5 tỷ tham số, bỏ qua bước "mơ" khi suy luận). Vườn thú VLA đã được mở rộng: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B với flow-matching), MolmoAct2 (Viện Nghiên cứu Trí tuệ Nhân tạo Allen, hỗ trợ toàn bộ chu trình huấn luyện và triển khai, khoảng 12 GB khi suy luận, 24 GB cho LoRA), EO-1 (Qwen2.5-VL-3B với flow-matching), Multitask DiT (450 triệu tham số, điều kiện dựa trên CLIP), EVO1 (0,77 tỷ tham số, InternVL3-1B). Một giao diện lập trình ứng dụng (API) thống nhất đã được giới thiệu cho các mô hình phần thưởng: Robometer (Qwen3-VL-4B, mô hình tổng quát được tiền huấn luyện, đánh giá tiến độ và thành công) và TOPReward (thiết lập zero-shot, sử dụng log-xác suất của token "True"). Sáu chuẩn đánh giá mô phỏng mới: LIBERO-plus (10.000 biến thể nhiễu loạn), RoboTwin 2.0 (50 nhiệm vụ trên SAPIEN với ngẫu nhiên hóa miền), RoboCasa365 (365 nhiệm vụ trên 2.500 căn bếp), RoboCerebra (tầm nhìn dài, 3–6 mục tiêu con), RoboMME (kiểm tra bộ nhớ), VLABench (kiến thức và suy luận). Tất cả các chuẩn đánh giá có thể được chạy thông qua giao diện dòng lệnh (CLI) thống nhất lerobot-eval. Giao diện dòng lệnh lerobot-rollout bao gồm các chiến lược: sentry (ghi liên tục với xoay vòng), highlight (bộ đệm vòng), episodic (ghi cổ điển) và dagger (chỉnh sửa của con người với cờ can thiệp). Trong tập dữ liệu: mã hóa video với bất kỳ codec nào (bao gồm phần cứng NVENC, VideoToolbox, VAAPI, QSV), hỗ trợ độ sâu từ Intel RealSense, chú thích ngôn ngữ tự động qua mô hình ngôn ngữ thị giác (VLM) (lerobot-annotate), tăng tốc tải dữ liệu lên đến 2 lần thông qua giải mã song song và khung hình uint8 nhỏ gọn. Huấn luyện FSDP và huấn luyện đám mây trên HF Jobs.
Nguồn: Hugging Face blog —
bản gốc
