Car-GPT: Могут ли LLM наконец сделать беспилотные автомобили реальностью?
OpenAI
Wayve
В статье рассматривается возможность применения больших языковых моделей (LLM) в области автономного вождения. Автор описывает три ключевые задачи, решаемые с помощью LLM: восприятие окружающей среды, планирование траектории и генерация данных. Отмечается, что использование LLM в беспилотных автомобилях всё ещё находится на ранней стадии исследований.
Статья начинается с исторической аналогии: случайное открытие пенициллина Александром Флемингом, которое решило проблему, казавшуюся неразрешимой традиционными методами. Автор проводит параллель с беспилотными автомобилями, где десятилетиями использовался модульный подход (восприятие, локализация, планирование, управление), а затем появилось сквозное обучение, но обе парадигмы пока не привели к полностью автономному вождению. Теперь исследователи всерьёз рассматривают LLM как потенциальное решение. Автор даёт базовое объяснение LLM: токенизация (преобразование текста в числа), архитектура трансформеров и предсказание следующего слова. Для адаптации к автономному вождению входными данными становятся изображения, данные сенсоров (LiDAR, RADAR) или результаты алгоритмов, которые токенизируются с помощью Vision Transformer. Выходные данные могут быть различными: описание сцены, команды управления (например, перестроение) или ответы на вопросы. Выделены три активных направления исследований: восприятие (обнаружение объектов, их отслеживание и прогнозирование), планирование (принятие решений на основе карты и поведения человека) и генерация (создание синтетических сцен для обучения). Среди примеров упоминаются модели HiLM-D, MTD-GPT, PromptTrack (для восприятия), Talk2BEV, DriveGPT (для планирования), а также GAIA-1, MagicDrive, Driving Into the Future, Driving Diffusion (для генерации). Автор отмечает, что до сих пор не решена проблема «чёрного ящика» и галлюцинаций LLM, а первые статьи на эту тему появились лишь в середине 2023 года, поэтому окончательный вывод преждевременен.
- Сокращения
- LLM = Large Language Model — большая языковая модель
- GPT = Generative Pre-trained Transformer — генеративный предобученный трансформер
- LiDAR = Light Detection and Ranging — лазерный радар (лидар)
- RADAR = Radio Detection and Ranging — радиолокатор (радар)
- BEV = Bird's Eye View — вид сверху (птичий полёт)
- MTD = Multi-Task Detection — многозадачное обнаружение
Источник: The Gradient —
оригинал
