近日,英伟达(NVIDIA)宣布推出了一款名为 Alpamayo 2 Super 的全新开源模型。作为该公司在自动驾驶和机器人技术领域的又一力作,Alpamayo 2 Super 是一个参数规模达 340 亿(34B)的视觉-语言-动作模型。该模型旨在解决自动驾驶车辆在复杂交通环境中的决策难题,标志着 NVIDIA 在开源生成式世界模型(Cosmos)生态中的又一重要布局。
混合架构与性能突破
Alpamayo 2 Super 采用了独特的混合架构设计,结合了 320 亿参数的 Cosmos 3 Super Reasoner 骨干网络与 23 亿参数的扩散动作解码器。这种“大脑+小脑”的组合使其不仅具备强大的逻辑推理能力,还能生成高精度的动作轨迹。在针对自动驾驶场景设计的基准测试 LingoQA 中,Alpamayo 2 Super 取得了 79.2 的优异得分,展现了其在理解视觉指令并转化为实际行动方面的卓越能力。
开放许可与商业友好
与许多受限制的开源大模型不同,Alpamayo 2 Super 基于开放的多模态数据工作流(OpenMDW)协议 1.1 版本发布。这意味着开发者不仅可以自由地微调模型以适应特定场景,还可以对其进行衍生开发,甚至进行商业分发。这种“开放且友好”的授权方式极大地降低了汽车制造商和自动驾驶初创企业的技术门槛,有望加速 L4 级自动驾驶技术的普及。
从感知到行动的闭环
传统的自动驾驶模型往往侧重于环境感知(视觉)和路径规划,而 Alpamayo 2 Super 则致力于打通“感知-决策-行动”的闭环。该模型具备从单次前向传播中输出多种关键信息的能力,包括车辆的运动轨迹、因果链(Chain-of-Causation)推理过程、元动作定义以及自动标注的视觉问答(VQA)结果。这些输出对于提升自动驾驶系统的可解释性至关重要,因为工程师可以通过因果链清晰地了解模型做出某个驾驶决策的具体原因。
行业影响与应用前景
随着机器人出租车和智能驾驶舱技术的快速发展,对多模态大模型的需求日益迫切。Alpamayo 2 Super 的发布,为行业提供了一个强大的基础模型。它不仅能处理复杂的视觉信息,还能理解自然语言指令,这使得它非常适合用于训练能够理解乘客指令并自动执行泊车等操作的智能系统。通过结合 NVIDIA 强大的 Cosmos 世界模型,该模型有望在未来的自动驾驶仿真测试和现实部署中发挥关键作用。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/05/nvidia-alpamayo-2-super-open-vla-model-autonomous-driving/
封面图片来源:Unsplash / 摄影师 Mariia Shalabaieva
