当大模型遇上方向盘:一场关于自动驾驶的极限实验
在生成式人工智能(AIGC)爆发的今天,人们往往容易陷入一种技术乌托邦的想象:拥有超强推理能力的大语言模型(LLM)不仅能写代码、画画,甚至能像科幻电影那样直接接管现实世界。然而,现实往往比想象更骨感。近日,美国科技媒体《Wired》进行了一项极具实验性的挑战:三名工程师试图将目前最先进的大语言模型——GPT、Claude 和 Grok——植入一辆真实的丰田卡罗拉中,看看它们能否在复杂的现实交通环境中完成一次简单的“任务:前往In-N-Out汉堡店”。结果令人唏嘘:在这次残酷的测试中,只有一位“选手”勉强胜出。
从文本到物理:具身智能的尴尬时刻
这项实验的核心在于验证大模型在“具身智能”领域的潜力。具身智能指的是将智能体嵌入到物理实体中,使其能够感知环境并执行操作。自动驾驶无疑是具身智能皇冠上的明珠,但将一个主要基于文本训练的LLM直接转化为驾驶者,并非简单的“插上电源就能跑”。
在实验中,工程师们为三辆车分别赋予了GPT-4、Claude 3.5 Sonnet和Grok 1模型。这些模型虽然在处理自然语言对话、逻辑推理和代码生成上表现卓越,但当它们面对雷达、摄像头传回的实时环境数据时,却频频出现“幻觉”。它们会错误地解读传感器数据,或者在复杂的交通路口做出完全违背物理常识的决策。例如,模型可能会因为无法准确理解瞬息万变的路况,导致车辆在路口停滞不前,甚至在绿灯亮起时因犹豫而错过最佳时机。
最终,只有Grok(xAI推出的模型)在工程师精心设计的工具链支持下,成功引导车辆完成了从起点到In-N-Out汉堡店的行驶。但这并不意味着大模型已经具备了成熟的自动驾驶能力,相反,这次实验更像是一次“达尔文式”的筛选,揭示了当前大模型在处理连续性、实时性和物理交互时的巨大鸿沟。
大模型的短板:为什么它们不适合当司机?
大语言模型的训练方式决定了其局限性。它们是基于海量文本数据训练出来的概率预测模型,擅长的是“补全”下一个词,而非处理高维度的物理传感器数据。在自动驾驶领域,车辆需要毫秒级的反应速度和极高的精确度,而大模型往往存在“推理延迟”,且容易在处理多模态信息时产生混淆。
此外,大模型在面对未知情况时的“胆怯”或“过度自信”也是致命伤。在真实的交通流中,遇到突发状况(如行人横穿马路或车辆加塞)时,自动驾驶系统必须迅速做出决策。而目前的LLM往往倾向于保守,或者因为过度分析而陷入僵局,这在分秒必争的道路上是不可接受的。
行业启示:从“大脑”到“躯壳”的进化之路
《Wired》的这次实验对行业具有重要的警示意义。它表明,单纯依靠大模型的“智力”并不足以解决自动驾驶的工程难题。真正的自动驾驶系统需要的是“眼睛”(视觉感知)、“手脚”(车辆控制)和“大脑”(决策算法)的完美协同。
目前,头部自动驾驶公司(如Waymo、Tesla等)依然采用基于视觉Transformer(ViT)和卷积神经网络(CNN)的专用模型,而非通用大模型。这些模型经过专门的数据训练,对路况的理解更为精准和鲁棒。未来的趋势或许是“多模态大模型”的崛起,例如GPT-4V或GPT-4o,它们能够直接“看懂”图像和视频,这为通过视觉输入来驱动车辆提供了可能。然而,即便如此,如何解决实时性、安全性和长尾场景的处理,依然是横亘在大模型与自动驾驶之间的一座大山。
综上所述,让GPT、Claude和Grok开着丰田卡罗拉去汉堡店,不仅是一次有趣的科技秀,更是一面镜子,映照出通用人工智能(AGI)在迈向物理世界时所必须跨越的鸿沟。我们离“AI代驾”的普及时代或许还有很长的路要走,但至少在这一刻,人类依然需要紧握方向盘。
信息来源:Feed: Artificial Intelligence Latest,原文链接:https://www.wired.com/story/ai-is-driving-cars-now-oh-boy/
封面图片来源:Unsplash / 摄影师 Bestami Sarıkaya
