InvestigaciónAplicaciones 🇺🇸 29.07.2026 00:02

Car-GPT: ¿Podrían los LLM hacer realidad los coches autónomos?

OpenAIOpenAI MetaMeta WayveWayve xAIxAI
El artículo explora el potencial de los Modelos de Lenguaje de Gran Escala (LLM, por sus siglas en inglés) para revolucionar la conducción autónoma, estableciendo un paralelismo con el descubrimiento accidental de la penicilina por Alexander Fleming. Explica cómo los LLM, mediante tokenización, transformadores y predicción de la siguiente palabra, pueden adaptarse a tareas de conducción autónoma como la percepción, la planificación y la generación. Sin embargo, los problemas de confianza y de caja negra siguen sin resolverse, y es demasiado pronto para saber si los LLM serán la clave para los vehículos completamente autónomos.
El artículo compara el estado actual de la investigación de vehículos autónomos con el descubrimiento accidental de la penicilina, sugiriendo que los Grandes Modelos de Lenguaje (en adelante, GML) podrían ser el avance inesperado. Explica que la conducción autónoma tradicional utiliza un enfoque modular (percepción, localización, planificación, control), mientras que el aprendizaje de extremo a extremo reemplaza todos los módulos con una única red neuronal, creando un problema de caja negra. Los GML funcionan mediante tokenización (conversión de texto a números), transformadores (arquitectura basada en atención) y predicción de la siguiente palabra. Para la conducción autónoma, las entradas pueden ser imágenes o datos de sensores tokenizados de manera similar, y las tareas incluyen percepción (detección, predicción, seguimiento), planificación (toma de decisiones, navegación) y generación (creación de datos de entrenamiento o escenarios). Ejemplos como Talk2BEV y DriveGPT utilizan GML para mejorar la percepción de Vista de Pájaros y planificar trayectorias, mientras que GAIA-1 y MagicDrive generan videos o escenas. Sin embargo, las preocupaciones sobre alucinaciones y la falta de determinismo hacen que la confianza en los GML para la conducción en tiempo real sea incierta, y es demasiado pronto para concluir.
Fuente: The Gradient — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas