Código AbertoRobótica 🇺🇸 27.07.2026 04:06

LeRobot v0.6.0: Políticas Baseadas em Modelo de Mundo, Novo VLA, Benchmarks e CLI para Avaliação

Hugging FaceHugging Face NVIDIANVIDIA Allen Institute for AIAllen Institute for AI Alibaba/QwenAlibaba/Qwen
O LeRobot v0.6.0 foi lançado com suporte para três políticas baseadas em modelo de mundo (VLA-JEPA, FastWAM, LingBot-VA), novo VLA (GR00T N1.7, MolmoAct2, EO-1, EVO1, Multitask DiT) e uma API unificada para modelos de recompensa (Robometer, TOPReward). Seis novos benchmarks de simulação foram adicionados e integrados ao lerobot-eval, um CLI lerobot-rollout com correções DAgger, suporte a profundidade, anotação automática de linguagem e aceleração de até 2x no carregamento de dados.
LeRobot v0.6.0 apresenta três políticas de modelo pacíficas: VLA-JEPA (predição futura no espaço latente sem custo de inferência), LingBot-VA (predição autoregressiva de vídeo e ação com capacidade de salvar vídeos previstos), FastWAM (gerador de vídeo de 5 bilhões de parâmetros, eliminando o "sonho" na inferência). O zoológico VLA foi expandido: GR00T N1.7 (NVIDIA, Cosmos-Reason2-2B com flow-matching), MolmoAct2 (Allen Institute for AI, suporte para ciclo completo de treinamento e implantação, ~12 GB na inferência, 24 GB para LoRA), EO-1 (Qwen2.5-VL-3B com flow-matching), Multitask DiT (450 milhões de parâmetros, condicionado no CLIP), EVO1 (0,77 bilhões de parâmetros, InternVL3-1B). Uma API unificada foi introduzida para modelos de recompensa: Robometer (Qwen3-VL-4B, modelo geral pré-treinado, avalia progresso e sucesso) e TOPReward (configuração zero-shot, usa log-probabilidade do token "True"). Seis novos benchmarks de simulação: LIBERO-plus (10.000 variantes perturbadas), RoboTwin 2.0 (50 tarefas no SAPIEN com randomização de domínio), RoboCasa365 (365 tarefas em 2.500 cozinhas), RoboCerebra (horizontes longos, 3–6 subobjetivos), RoboMME (testes de memória), VLABench (conhecimento e raciocínio). Todos os benchmarks podem ser executados via o CLI unificado lerobot-eval. O CLI lerobot-rollout inclui estratégias: sentry (gravação contínua com rotação), highlight (buffer circular), episodic (gravação clássica) e dagger (correções humanas com sinalização de intervenção). Em datasets: codificação de vídeo com qualquer codec (incluindo hardware NVENC, VideoToolbox, VAAPI, QSV), suporte para profundidade do Intel RealSense, anotação automática de linguagem via VLM (lerobot-annotate), aceleração de até 2x na carga de dados através de decodificação paralela e quadros uint8 compactos. Treinamento FSDP e treinamento em nuvem no HF Jobs.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas