NVIDIA تطلق Alpamayo 2 Super: نموذج مفتوح للرؤية واللغة والفعل بحجم 34 مليار معامل لقيادة الروبوتات والقيادة الذاتية بموجب OpenMDW-1.1
NVIDIA
أصدرت NVIDIA نموذج Alpamayo 2 Super، وهو نموذج رؤية-لغة-فعل (VLA) بحجم 34 مليار معامل للقيادة الذاتية، بموجب ترخيص تجاري مفتوح. يتميز في معالجة الأحداث النادرة، ويُخرج المسار والتفسيرات السببية والإجراءات الوصفية من مقطع واحد من فيديو الكاميرا. تم إصدار الأوزان بموجب ترخيص OpenMDW-1.1، مع كود مصدر بموجب Apache 2.0، مما يتيح النشر التجاري.
أعلنت NVIDIA عن إطلاق نموذج Alpamayo 2 Super، وهو نموذج رؤية-لغة-فعل (VLA) يحتوي على 34 مليار معامل، مخصص للقيادة الذاتية، وتم إصداره بموجب ترخيص OpenMDW-1.1 المسموح. يجمع النموذج بين هيكل رئيسي للرؤية-اللغة (VLM) بحجم 32 مليار معامل مبني على NVIDIA Cosmos 3 Super Reasoner، ومفكك تشفير للحركة يعتمد على الانتشار بحجم 2.3 مليار معامل، مصمم للتعامل مع السيناريوهات المعقدة متعددة الوكلاء والطويلة الذيل. من خلال تمريرة واحدة على فيديو الكاميرات المحيطية الكاملة، ينتج مسارًا مخططًا، وشرحًا سببيًا (مسار سلسلة الأسباب)، وفعلًا وصفًا. تم إصدار الأوزان بموجب ترخيص OpenMDW-1.1، بينما الكود المصدري بموجب Apache 2.0، مما يسمح بالاستخدام التجاري والضبط الدقيق وإعادة التوزيع. تتضمن بيانات التدريب حوالي 115,000 ساعة من فيديو القيادة متعدد الكاميرات، و3.7 مليون تتبع لسلسلة الأسباب، وأكثر من مليار صورة. على معيار LingoQA، سجل النموذج 79.2 على Lingo-Judge، متجاوزًا Qwen2.5-VL 72B بمقدار 17.0 نقطة، وGemini 2.5 Pro بمقدار 15.1 نقطة، وGPT-4o بمقدار 23.2 نقطة. التقييم ذو الحلقة المغلقة باستخدام AlpaSim على 910 سيناريوهات يعطي درجة AlpaSim تبلغ 1.50 ± 0.13، بينما التقييم ذو الحلقة المفتوحة على 937 عينة يعطي حدًا أدنى لمتوسط الخطأ المطلق ADE₆ عند 6.4 ثانية يبلغ 0.911 مترًا. كما يدعم النموذج وسم البيانات تلقائيًا، مما يقلص دورات التعليق التوضيحي من أشهر إلى أيام، ويتكامل مع NVIDIA Halos للتحقق من السلامة.
المصدر: MarkTechPost —
الأصلي
