сетью, создавая проблему «черного ящика». LLM работают через токенизацию (преобразование текста в числа), трансформеры (архитектура на основе внимания) и предсказание следующего слова. Для беспилотного вождения входные данные, такие как изображения или данные сенсоров, можно токенизировать аналогичным образом, а задачи включают восприятие (обнаружение, прогнозирование, отслеживание), планирование (принятие решений, навигацию) и генерацию (создание данных для обучения или сценариев). Примеры, такие как Talk2BEV и DriveGPT, используют LLM для улучшения восприятия BEV (Bird's-Eye View, вид сверху) и планирования траекторий, в то время как GAIA-1 и MagicDrive генерируют видео или сцены. Однако опасения по поводу галлюцинаций и отсутствия детерминированности ставят под сомнение доверие к LLM для управления автомобилем в реальном времени, и делать выводы пока рано.