研究应用 🇺🇸 29.07.2026 00:02

Car-GPT:大型语言模型能否最终实现自动驾驶?

OpenAIOpenAI MetaMeta WayveWayve xAIxAI
本文探讨了大型语言模型(LLM)革新自动驾驶的潜力,并将其与亚历山大·弗莱明偶然发现青霉素相类比。文章解释了LLM如何通过分词、变换器和下一个词预测等机制,适用于感知、规划和生成等自动驾驶任务。然而,信任和黑箱问题仍未解决,现在判断LLM是否将成为全自动驾驶汽车的关键为时过早。
这篇文章将自动驾驶研究的现状比作青霉素的意外发现,并暗示大语言模型(Large Language Model,LLM)或许正是那个出乎意料的突破口。文章解释道,传统的自动驾驶采用模块化方法(感知、定位、规划、控制),而端到端学习则用单一神经网络取代所有模块,由此带来了“黑箱”问题。 大语言模型的工作原理包括:分词(将文本转换为数字)、Transformer(基于注意力机制的架构)以及下一词预测。在自动驾驶领域,输入既可以是图像,也可以是经过类似方式分词处理的传感器数据,任务则涵盖感知(检测、预测、跟踪)、规划(决策、导航)以及生成(创建训练数据或场景)。 诸如Talk2BEV和DriveGPT等例子,便是利用大语言模型来增强鸟瞰图(Bird's Eye View,BEV)感知能力并规划行驶轨迹,而GAIA-1和MagicDrive则用于生成视频或场景。然而,由于存在“幻觉”问题以及缺乏确定性,人们对于将大语言模型用于实时驾驶是否值得信赖仍心存疑虑,目前下结论还为时尚早。
来源: The Gradient — 原文
我们之前关于此话题的帖子 ↓
最新新闻