Car-GPT: ¿Podrían por fin los LLM hacer realidad los coches autónomos?
OpenAI
Meta
Wayve
xAI
El artículo explora el potencial de los Modelos de Lenguaje Grande (LLM) para revolucionar la conducción autónoma, estableciendo un paralelismo con el descubrimiento accidental de la penicilina por Alexander Fleming. Explica cómo los LLM, a través de la tokenización, los transformadores y la predicción de la siguiente palabra, pueden adaptarse para tareas de conducción autónoma como la percepción, la planificación y la generación. Sin embargo, los problemas de confianza y la naturaleza de caja negra siguen sin resolverse, y es demasiado pronto para saber si los LLM serán la clave para los vehículos totalmente autónomos.
El artículo compara el estado actual de la investigación de vehículos autónomos con el descubrimiento accidental de la penicilina, sugiriendo que los Grandes Modelos de Lenguaje (en adelante, GML) podrían ser el avance inesperado. Explica que la conducción autónoma tradicional utiliza un enfoque modular (percepción, localización, planificación, control), mientras que el aprendizaje de extremo a extremo reemplaza todos los módulos con una única red neuronal, creando un problema de caja negra. Los GML funcionan mediante tokenización (conversión de texto a números), transformadores (arquitectura basada en atención) y predicción de la siguiente palabra. Para la conducción autónoma, las entradas pueden ser imágenes o datos de sensores tokenizados de manera similar, y las tareas incluyen percepción (detección, predicción, seguimiento), planificación (toma de decisiones, navegación) y generación (creación de datos de entrenamiento o escenarios). Ejemplos como Talk2BEV y DriveGPT utilizan GML para mejorar la percepción de Vista de Pájaros y planificar trayectorias, mientras que GAIA-1 y MagicDrive generan videos o escenas. Sin embargo, las preocupaciones sobre alucinaciones y la falta de determinismo hacen que la confianza en los GML para la conducción en tiempo real sea incierta, y es demasiado pronto para concluir.
Fuente: The Gradient —
original
