Google DeepMind 推出 Gemini Robotics 2,三大物理 AI 模型引领机器人控制与协作新纪元

在人工智能飞速发展的今天,具身智能正成为科技巨头竞相角逐的下一个高地。据 MarkTechPost 报道,Google DeepMind 于 2026 年 7 月正式推出了其下一代机器人的核心智能层——Gemini Robotics 2。这一发布标志着物理 AI 模型在控制精度、操作灵活性以及多机器人协作能力上取得了突破性进展。

Gemini Robotics 2 的核心价值在于其作为一个通用的智能层,能够将大语言模型(LLM)的强大认知能力赋予物理实体。此次发布包含三大关键模型,分别针对不同的应用场景进行了深度优化。

全身控制与精细操作

首个模型是基于视觉-语言-动作(VLA)架构的全身控制模型。这一模型赋予机器人全身协调运动的能力,使其能够执行复杂的精细操作任务。通过结合视觉感知、语言指令和动作规划,Gemini Robotics 2 让机器人不仅能“看懂”环境,还能像人类一样灵活地移动和操作物体。这对于人形机器人在家庭或工业环境中的落地应用至关重要,它解决了传统机器人“只有手没有身”的痛点。

具身推理与任务编排

第二个核心组件是 Gemini Robotics ER 2(Embodied Reasoning 2)。该模型专注于具身推理和任务编排。ER 2 模型不仅能够执行单一动作,还能理解复杂的任务逻辑,将大目标拆解为可执行的子步骤。尤为重要的是,DeepMind 目前仅将 ER 2 模型作为公开资源发布,这为全球的研究人员和开发者提供了一个宝贵的测试平台,有助于加速具身智能算法的迭代。

惊人的硬件适应速度

第三大亮点是设备端的 VLA 模型。过去,训练机器人适应新的机械结构往往需要数月甚至更久的时间,需要大量的数据标注和调优。而 Gemini Robotics 2 的设备端模型能够在短短数小时内完成对新机器人身体的适应。这种高效的迁移能力极大地降低了机器人部署的门槛,使得企业能够快速将 AI 技术应用到不同的硬件平台上,显著提升了研发效率。

多机器人协作的实践

Gemini Robotics 2 的能力已经在实际硬件上得到了验证。官方测试数据显示,仅通过一个检查点,该模型就成功驱动了 Apptronik Apollo 2 人形机器人和 Franka Duo 机械臂。这证明了其在不同物理形态间的泛化能力,同时也展示了多机器人协作的潜力——即多个机器人如何协同工作以完成更复杂的任务。

从行业影响来看,Gemini Robotics 2 的发布进一步巩固了 Google DeepMind 在通用机器人领域的领导地位。面对 OpenAI、Tesla Optimus 等竞争对手的激烈竞争,DeepMind 通过开源 ER 2 模型并展示强大的端到端能力,试图抢占开源生态的高地。未来,随着这些模型在工业制造、物流仓储以及家庭服务领域的深入应用,我们将见证物理世界与数字智能的深度融合。

随着 2026 年这一时间节点的临近,Gemini Robotics 2 的出现无疑为即将到来的具身智能爆发期按下了加速键。

参考来源:MarkTechPost

原文链接

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/30/google-deepmind-gemini-robotics-2-whole-body-control-dexterity-multi-robot-collaboration/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注