英伟达发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的开源 34B 视觉-语言-动作模型,采用 OpenMDW-1.1 许可
NVIDIA
英伟达发布了 Alpamayo 2 Super,这是一款拥有 340 亿参数的视觉-语言-动作(VLA)模型,专为自动驾驶设计,采用开放商业许可。该模型在长尾事件中表现出色,能够通过单次相机视频输入输出轨迹、因果解释和元动作。模型权重在 OpenMDW-1.1 许可下发布,源代码采用 Apache 2.0 许可,支持商业部署。
NVIDIA推出了Alpamayo 2 Super,这是一款用于自动驾驶的34B参数视觉-语言-动作(VLA)模型,采用宽松的OpenMDW-1.1许可证发布。该模型将基于NVIDIA Cosmos 3 Super Reasoner的32B VLM骨干与2.3B基于扩散的动作解码器配对,旨在处理长尾、多智能体驾驶场景。通过对全景摄像头视频的单次处理,它能生成规划轨迹、因果解释(因果链追踪)以及元动作。权重根据OpenMDW-1.1发布,源代码采用Apache 2.0,允许商业使用、微调和再分发。训练数据包括约11.5万小时的多摄像头驾驶视频、370万条因果链追踪以及超过10亿张图像。在LingoQA上,它的Lingo-Judge得分为79.2,比Qwen2.5-VL 72B高出17.0分,比Gemini 2.5 Pro高出15.1分,比GPT-4o高出23.2分。使用AlpaSim对910个场景进行的闭环评估得出AlpaSim得分为1.50 ± 0.13,对937个样本的开环评估在6.4秒时的minsADE₆为0.911米。该模型还支持自动标注,将标注周期从数月压缩至数天,并与NVIDIA Halos集成以进行安全验证。
来源: MarkTechPost —
原文
