Mô hìnhPhần cứng & Suy luận 🇺🇸 05.08.2026 12:01

NVIDIA phát hành Alpamayo 2 Super: Mô hình thị giác-ngôn ngữ-hành động 34B mã nguồn mở cho robotaxi và xe tự lái theo giấy phép OpenMDW-1.1

NVIDIANVIDIA
NVIDIA đã phát hành Alpamayo 2 Super, một mô hình thị giác-ngôn ngữ-hành động (VLA) với 34 tỷ tham số dành cho xe tự lái, theo giấy phép thương mại mã nguồn mở. Mô hình này vượt trội trong các tình huống đuôi dài, tạo ra quỹ đạo, giải thích nguyên nhân và các hành động meta từ một lần duyệt video camera. Trọng số được phát hành theo OpenMDW-1.1, với mã nguồn Apache 2.0, cho phép triển khai thương mại.
NVIDIA đã giới thiệu Alpamayo 2 Super, một mô hình thị giác-ngôn ngữ-hành động (VLA) với 34 tỷ tham số dành cho lái xe tự động, được phát hành theo giấy phép OpenMDW-1.1 cho phép. Mô hình kết hợp một bộ xử lý nền tảng VLM 32 tỷ tham số được xây dựng trên NVIDIA Cosmos 3 Super Reasoner với một bộ giải mã hành động dựa trên khuếch tán 2,3 tỷ tham số, được thiết kế để xử lý các tình huống lái xe đa tác nhân có độ dài đuôi dài. Từ một lần xử lý duy nhất video camera bao quanh toàn cảnh, mô hình tạo ra một quỹ đạo dự kiến, một giải thích nhân quả (chuỗi vết nhân quả) và một hành động siêu cấp. Các trọng số được phát hành theo OpenMDW-1.1, với mã nguồn theo Apache 2.0, cho phép sử dụng thương mại, tinh chỉnh và phân phối lại. Dữ liệu huấn luyện bao gồm khoảng 115.000 giờ video lái xe nhiều camera, 3,7 triệu chuỗi vết nhân quả và hơn một tỷ hình ảnh. Trên LingoQA, mô hình đạt 79,2 điểm Lingo-Judge, vượt qua Qwen2.5-VL 72B 17,0 điểm, Gemini 2.5 Pro 15,1 điểm và GPT-4o 23,2 điểm. Đánh giá vòng lặp đóng với AlpaSim trên 910 tình huống cho điểm AlpaSim là 1,50 ± 0,13, và đánh giá vòng lặp mở trên 937 mẫu cho chỉ số minADE₆ ở 6,4 giây là 0,911 mét. Mô hình cũng hỗ trợ tự động gán nhãn, giảm chu kỳ chú thích từ nhiều tháng xuống còn vài ngày, và tích hợp với NVIDIA Halos để xác thực an toàn.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới