Car-GPT: Büyük Dil Modelleri Nihayet Sürücüsüz Arabaları Gerçeğe Dönüştürebilir mi?
OpenAI
Meta
Wayve
xAI
Makale, Büyük Dil Modellerinin (LLM'ler) otonom sürüşü devrimleştirme potansiyelini, Alexander Fleming'in tesadüfi penisilin keşfine benzeterek inceliyor. LLM'lerin tokenizasyon, transformatörler ve sonraki kelime tahmini yoluyla algılama, planlama ve üretim gibi otonom sürüş görevlerine nasıl uyarlanabileceğini açıklıyor. Ancak, güven ve kara kutu sorunları çözülmemiş durumda ve LLM'lerin tam otonom araçların anahtarı olup olmayacağını söylemek için henüz erken.
Makale, otonom araç araştırmalarının mevcut durumunu penisilinin tesadüfen keşfine benzeterek, LLM'lerin beklenmedik bir atılım olabileceğini öne sürüyor. Geleneksel otonom sürüşün modüler bir yaklaşım (algı, konumlandırma, planlama, kontrol) kullandığını, uçtan uca öğrenmenin ise tüm modülleri tek bir sinir ağıyla değiştirerek bir kara kutu sorunu yarattığını açıklıyor. LLM'ler, tokenizasyon (metni sayılara dönüştürme), transformer'lar (dikkat tabanlı mimari) ve sonraki kelime tahmini yoluyla çalışır. Otonom sürüş için girdiler, benzer şekilde tokenize edilmiş görüntüler veya sensör verileri olabilir ve görevler arasında algılama (tespit, tahmin, takip), planlama (karar verme, navigasyon) ve üretim (eğitim verisi veya senaryo oluşturma) yer alır. Talk2BEV ve DriveGPT gibi örnekler, LLM'leri BEV algısını geliştirmek ve yörünge planlamak için kullanırken, GAIA-1 ve MagicDrive video veya sahneler üretir. Ancak, halüsinasyonlar ve belirlilik eksikliği ile ilgili endişeler, gerçek zamanlı sürüş için LLM'lere güveni belirsiz kılıyor ve sonuca varmak için çok erken.
Kaynak: The Gradient —
orijinal
