NVIDIA lanza Alpamayo 2 Super: un modelo abierto de visión-lenguaje-acción de 34B para robotaxis y conducción autónoma bajo OpenMDW-1.1
NVIDIA
NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros para conducción autónoma, bajo una licencia comercial abierta. Destaca en eventos de cola larga, genera trayectoria, explicaciones causales y meta-acciones a partir de una sola pasada de video de cámara. Los pesos se publican bajo OpenMDW-1.1, con código fuente bajo Apache 2.0, lo que permite el despliegue comercial.
NVIDIA ha presentado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros para conducción autónoma, publicado bajo la licencia permisiva OpenMDW-1.1. El modelo combina una columna vertebral VLM de 32B construida sobre NVIDIA Cosmos 3 Super Reasoner con un decodificador de acciones basado en difusión de 2.3B, diseñado para manejar escenarios de conducción de cola larga y multiagente. A partir de una sola pasada sobre el video de cámaras de alrededor de 360 grados, produce una trayectoria planificada, una explicación causal (traza de Cadena de Causalidad) y una meta-acción. Los pesos se publican bajo OpenMDW-1.1, con el código fuente bajo Apache 2.0, lo que permite uso comercial, ajuste fino y redistribución. Los datos de entrenamiento incluyen alrededor de 115,000 horas de video de conducción con múltiples cámaras, 3.7 millones de trazas de Cadena de Causalidad y más de mil millones de imágenes. En LingoQA, obtiene 79.2 en Lingo-Judge, superando a Qwen2.5-VL 72B por 17.0 puntos, a Gemini 2.5 Pro por 15.1 y a GPT-4o por 23.2. La evaluación de bucle cerrado con AlpaSim en 910 escenarios da una puntuación AlpaSim de 1.50 ± 0.13, y la evaluación de bucle abierto en 937 muestras da un minADE₆ a 6.4s de 0.911m. El modelo también admite autoetiquetado, comprimiendo los ciclos de anotación de meses a días, y se integra con NVIDIA Halos para la validación de seguridad.
Fuente: MarkTechPost —
original
