Car-GPT: Liệu LLMs cuối cùng có thể biến xe tự lái thành hiện thực?
OpenAI
Meta
Wayve
xAI
Bài viết khám phá tiềm năng của Mô hình Ngôn ngữ Lớn (LLMs) trong việc cách mạng hóa xe tự lái, ví von với khám phá tình cờ penicillin của Alexander Fleming. Nó giải thích cách LLMs, thông qua tokenization, transformers và dự đoán từ tiếp theo, có thể được áp dụng cho các tác vụ tự lái như nhận thức, lập kế hoạch và sinh dữ liệu. Tuy nhiên, các vấn đề về độ tin cậy và hộp đen vẫn chưa được giải quyết, và còn quá sớm để khẳng định liệu LLMs có phải là chìa khóa cho phương tiện hoàn toàn tự động hay không.
Bài viết so sánh tình trạng hiện tại của nghiên cứu xe tự lái với sự phát hiện tình cờ của penicillin, gợi ý rằng các mô hình ngôn ngữ lớn (LLM) có thể là đột phá bất ngờ. Nó giải thích rằng lái xe tự động truyền thống sử dụng phương pháp mô-đun (nhận thức, định vị, lập kế hoạch, điều khiển), trong khi học end-to-end thay thế tất cả các mô-đun bằng một mạng nơ-ron duy nhất, tạo ra vấn đề hộp đen. LLM hoạt động thông qua token hóa (chuyển văn bản thành số), transformers (kiến trúc dựa trên attention) và dự đoán từ tiếp theo. Đối với xe tự lái, đầu vào có thể là hình ảnh hoặc dữ liệu cảm biến được token hóa tương tự, và các nhiệm vụ bao gồm nhận thức (phát hiện, dự đoán, theo dõi), lập kế hoạch (ra quyết định, điều hướng) và sinh tạo (tạo dữ liệu huấn luyện hoặc kịch bản). Các ví dụ như Talk2BEV và DriveGPT sử dụng LLM để tăng cường nhận thức BEV và lập kế hoạch quỹ đạo, trong khi GAIA-1 và MagicDrive tạo video hoặc cảnh. Tuy nhiên, những lo ngại về ảo giác và thiếu tính xác định khiến niềm tin vào LLM cho lái xe thời gian thực chưa chắc chắn, và còn quá sớm để kết luận.
Nguồn: The Gradient —
bản gốc
