NVIDIA veröffentlicht Alpamayo 2 Super: Ein offenes 34B-Vision-Sprache-Aktions-Modell für Robotaxis und autonomes Fahren unter OpenMDW-1.1
NVIDIA
NVIDIA hat Alpamayo 2 Super veröffentlicht, ein 34B-Parameter-Vision-Sprache-Aktions-Modell (VLA) für autonomes Fahren, unter einer offenen kommerziellen Lizenz. Es zeichnet sich durch Long-Tail-Ereignisse aus und generiert aus einem einzigen Durchgang von Kameravideos Trajektorien, kausale Erklärungen und Meta-Aktionen. Die Gewichte werden unter OpenMDW-1.1 veröffentlicht, mit Apache-2.0-Quellcode, was den kommerziellen Einsatz ermöglicht.
NVIDIA hat Alpamayo 2 Super vorgestellt, ein Vision-Language-Action-Modell (VLA) mit 34 Milliarden Parametern für das autonome Fahren, das unter der permissiven Lizenz OpenMDW-1.1 veröffentlicht wurde. Das Modell kombiniert ein 32B-VLM-Rückgrat, das auf NVIDIA Cosmos 3 Super Reasoner basiert, mit einem 2,3B-Diffusions-basierten Aktionsdecoder und ist für langschwänzige Multi-Agenten-Fahrszenarien ausgelegt. In einem einzigen Durchgang über das Rundum-Kameravideo erzeugt es eine geplante Trajektorie, eine kausale Erklärung (Chain-of-Causation-Trace) und eine Meta-Aktion. Die Gewichte werden unter OpenMDW-1.1 veröffentlicht, der Quellcode unter Apache 2.0, was die kommerzielle Nutzung, das Feintuning und die Weiterverbreitung erlaubt. Die Trainingsdaten umfassen etwa 115.000 Stunden Multi-Kamera-Fahrvideo, 3,7 Millionen Chain-of-Causation-Traces und über eine Milliarde Bilder. Beim LingoQA erreicht es 79,2 beim Lingo-Judge und schlägt damit Qwen2.5-VL 72B um 17,0 Punkte, Gemini 2.5 Pro um 15,1 und GPT-4o um 23,2. Die Closed-Loop-Evaluation mit AlpaSim auf 910 Szenarien ergibt einen AlpaSim-Score von 1,50 ± 0,13, und die Open-Loop-Evaluation auf 937 Stichproben ergibt einen minADE₆ bei 6,4 Sekunden von 0,911 Metern. Das Modell unterstützt auch die automatische Beschriftung und verkürzt die Annotation-Zyklen von Monaten auf Tage, und es integriert sich in NVIDIA Halos für die Sicherheitsvalidierung.
Quelle: MarkTechPost —
Original
