Car-GPT: Büyük Dil Modelleri Nihayet Kendi Kendine Giden Arabaları Mümkün Kılabilir mi?
OpenAI
Meta
Wayve
xAI
Makale, Büyük Dil Modellerinin (LLM'ler) otonom sürüşü devrimleştirme potansiyelini, Alexander Fleming'in tesadüfi penisilin keşfine benzeterek inceliyor. Tokenizasyon, transformatörler ve sonraki kelime tahmini gibi LLM'lerin algılama, planlama ve üretim gibi kendi kendine sürüş görevlerine nasıl uyarlanabileceğini açıklıyor. Ancak, güven ve kara kutu sorunları çözülmemiş durumda ve LLM'lerin tam otonom araçların anahtarı olup olmayacağını söylemek için henüz çok erken.
Makale, otonom araç araştırmalarının mevcut durumunu penisilinin tesadüfen keşfine benzeterek, LLM'lerin beklenmedik bir atılım olabileceğini öne sürüyor. Geleneksel otonom sürüşün modüler bir yaklaşım (algı, konumlandırma, planlama, kontrol) kullandığını, uçtan uca öğrenmenin ise tüm modülleri tek bir sinir ağıyla değiştirerek bir kara kutu sorunu yarattığını açıklıyor. LLM'ler, tokenizasyon (metni sayılara dönüştürme), transformer'lar (dikkat tabanlı mimari) ve sonraki kelime tahmini yoluyla çalışır. Otonom sürüş için girdiler, benzer şekilde tokenize edilmiş görüntüler veya sensör verileri olabilir ve görevler arasında algılama (tespit, tahmin, takip), planlama (karar verme, navigasyon) ve üretim (eğitim verisi veya senaryo oluşturma) yer alır. Talk2BEV ve DriveGPT gibi örnekler, LLM'leri BEV algısını geliştirmek ve yörünge planlamak için kullanırken, GAIA-1 ve MagicDrive video veya sahneler üretir. Ancak, halüsinasyonlar ve belirlilik eksikliği ile ilgili endişeler, gerçek zamanlı sürüş için LLM'lere güveni belirsiz kılıyor ve sonuca varmak için çok erken.
Kaynak: The Gradient —
orijinal
