مفتوح المصدرالروبوتات 🇺🇸 27.07.2026 04:06

إصدار LeRobot v0.6.0: سياسات قائمة على النماذج العالمية، VLA جديدة، معايير وواجهة سطر أوامر للتقييم

Hugging FaceHugging Face NVIDIANVIDIA Allen Institute for AIAllen Institute for AI Alibaba/QwenAlibaba/Qwen
تم إصدار LeRobot v0.6.0 مع دعم لثلاث سياسات قائمة على النماذج العالمية (VLA-JEPA وFastWAM وLingBot-VA)، وVLA جديدة (GR00T N1.7 وMolmoAct2 وEO-1 وEVO1 وMultitask DiT)، وواجهة برمجة تطبيقات موحدة لنماذج المكافآت (Robometer وTOPOREward). تمت إضافة ستة معايير محاكاة جديدة ودمجها في lerobot-eval، وواجهة سطر أوامر lerobot-rollout مع تصحيحات DAgger، ودعم العمق، والتعليق اللغوي التلقائي، وتسريع تحميل البيانات بنسبة تصل إلى 2x.
يقدم الإصدار v0.6.0 من LeRobot ثلاث سياسات نموذجية سلمية: VLA-JEPA (التنبؤ بالمستقبل في الفضاء الكامن دون تكلفة استدلال)، وLingBot-VA (التنبؤ التلقائي بالفيديو والفعل مع القدرة على حفظ مقاطع الفيديو المتوقعة)، وFastWAM (مولد فيديو بخمسة مليارات معامل، يتجاوز "الحلم" عند الاستدلال). تم توسيع مجموعة نماذج VLA: GR00T N1.7 (من NVIDIA، مع Cosmos-Reason2-2B وتدفق المطابقة)، وMolmoAct2 (من معهد ألين للذكاء الاصطناعي، يدعم دورة التدريب والنشر الكاملة، بحوالي 12 جيجابايت عند الاستدلال و24 جيجابايت لـ LoRA)، وEO-1 (Qwen2.5-VL-3B مع تدفق المطابقة)، وMultitask DiT (450 مليون معامل، مشروط بـ CLIP)، وEVO1 (0.77 مليار معامل، مع InternVL3-1B). تم تقديم واجهة برمجية موحدة لنماذج المكافأة: Robometer (Qwen3-VL-4B، نموذج عام مُدرَّب مسبقًا، يقيم التقدم والنجاح) وTOP Reward (إعداد بدون تدريب مسبق، يستخدم الاحتمال اللوغاريتمي لرمز "True"). ستة معايير محاكاة جديدة: LIBERO-plus (10,000 متغير مُشوَّش)، وRoboTwin 2.0 (50 مهمة على SAPIEN مع عشوائية المجال)، وRoboCasa365 (365 مهمة عبر 2,500 مطبخ)، وRoboCerebra (آفاق زمنية طويلة، من 3 إلى 6 أهداف فرعية)، وRoboMME (اختبارات الذاكرة)، وVLABench (المعرفة والتفكير). يمكن تشغيل جميع المعايير عبر واجهة الأوامر الموحدة lerobot-eval. تتضمن واجهة الأوامر lerobot-rollout استراتيجيات: sentry (تسجيل مستمر مع تدوير)، وhighlight (مخزن مؤقت حلقي)، وepisodic (تسجيل كلاسيكي)، وdagger (تصحيحات بشرية مع علامة تدخل). في مجموعات البيانات: ترميز الفيديو بأي برنامج ترميز (بما في ذلك الأجهزة: NVENC وVideoToolbox وVAAPI وQSV)، ودعم العمق من كاميرا Intel RealSense، والشرح اللغوي التلقائي عبر نماذج الرؤية واللغة (lerobot-annotate)، وتسريع تحميل البيانات حتى مرتين عبر فك التشفير المتوازي وإطارات uint8 المدمجة. تدريب FSDP وتدريب سحابي على HF Jobs.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة