跳转到内容
主站 新闻 控制台

Gemini Robotics 2 为机器人带来全身智能

· DeepMind
DeepMind

2026年7月30日

模型

Carolina Parada

从脚尖到指尖——我们正在训练机器人实现智能全身控制、精细灵巧操作和协同合作,以完成广泛的复杂任务

几十年来,我们一直梦想着机器人能够无缝进入我们的世界并伸出援手。如今,这一愿景向前迈出了重要一步。

大多数机器人都被预先编程或远程操控,只能执行狭窄、重复的任务序列。它们缺乏真正自主学习或适应不可预测环境的能力。此外,将已学会的技能从一种机器人本体迁移到另一种本体仍然极其困难。要在大规模上应对最棘手的问题,各种形态和尺寸的机器人都需要由 AI 模型赋予它们思考、行动和智能交互的能力,从而安全地完成任务。

我们此前通过 Gemini Robotics 展示了 Gemini 的多模态理解如何驱动现实世界中的行动。今天,我们推出 Gemini Robotics 2——驱动下一代真正具备适应能力机器人的智能层。随着它迈出第一批字面意义上的“步伐”,这一重大进展解锁了智能全身控制、高级灵巧操作以及多机器人协作。

Gemini Robotics 2 使机器人能够推理每一个动作,解锁广泛的任务。例如,它可以让类人机器人行走、蹲下、伸展,并操控物体来清理杂乱的房间。它甚至可以与其他机器人协同完成工作,加快任务进度。而且,这种深层智能还可以在设备本地运行,同时在短短几个小时内无缝适配全新的机器人本体。

我们通过三款能力强大的模型实现这一切:

  • Gemini Robotics 2:我们最先进的视觉-语言-动作模型(VLA),可将视觉和语言输入转换为电机控制,使机器人能够采取行动。该模型能够控制整个类人机器人,从脚尖到指尖,以及其他双臂机器人。它还为双手和夹爪带来了全新层级的灵巧操作能力。
  • Gemini Robotics ER 2:我们最强大的具身推理(ER)模型。它是一个视觉语言模型(VLM),作为我们的智能体运行,使机器人能够与人类交流、理解物理世界,并规划持续数分钟的多步骤任务。我们还引入了让机器人作为团队协同工作的能力。
  • Gemini Robotics On-Device 2:我们最高效的视觉-语言-动作模型(VLA),专为在机器人设备本地运行而优化。该模型现在可以在仅需几个小时的数据后,快速适配完全新的机器人本体。

我们的推理模型 Gemini Robotics ER 2 现已在 Google AI Studio 上提供,并在 Gemini Enterprise Agent Platform 上开启私有预览。我们的 VLA 和 On-Device 模型向 早期访问合作伙伴 开放。了解如何将这些模型部署到你的硬件上,请查看我们的 开发者博客

运动中的类人机器人:管理全身任务

世界是为人类的动作而设计的;它要求我们在狭小、杂乱的空间中伸手、弯腰并保持平衡。虽然我们之前的模型控制类人机器人的上半身来完成桌面任务,但 Gemini Robotics 2 将物理 AI 扩展到了全身运动。

我们的模型首次能够控制整个类人机器人,将意图转化为智能全身控制。比如,在控制 Apptronik 的 Apollo 2 类人机器人时,我们可以让它执行“把浇水壶放到最底层架子上的绿色箱子里。”Apollo 会处理指令,走到桌子旁,拿起浇水壶,走几步到架子前,并将其精准放到目标位置。虽然我们的机器人在运动速度上仍有进一步提升空间,但这朝着完成更复杂、需要全身协同的现实任务所需技能迈出了重要一步。

为双手和夹爪带来高级灵巧操作

要在家庭和工作场所真正发挥作用,机器人需要具备细腻操作能力。Gemini Robotics 2 在不同末端执行器上解锁了新的物理灵巧水平,无论机器人使用的是手还是夹爪,都能让机器人比以往更加实用。

该模型现在可以控制 Apollo 2 机器人上的五指、22 自由度 SharpaWave 手,完成打结、封合密封袋等精细动作。它还可以操作 Franka Duo 平台 上标准的双指平行夹爪,执行复杂的灵巧任务,例如紧密打包。我们将继续提升精度和速度,以实现接近人类水平的灵巧操作。

通过智能体推理与多机器人协作解锁高级任务

大多数现实世界任务都需要在较长时间内分多个步骤完成。为应对这种复杂性,我们的具身推理(ER)模型 Gemini Robotics ER 2 充当机器人的高层“大脑”,处理用户指令并与人类沟通。它会观察房间,推理完成任务所需的步骤,与 VLA 协调执行动作,并跟踪进度直到任务完成。这样的架构使机器人能够执行复杂的多步骤任务,在某一步失败时自行纠正,并推广到新的情境和目标。

在本次更新中,我们让机器人能够更可靠地执行更长的任务序列,这些序列持续数分钟,涉及数百个决策。Gemini Robotics ER 2 现在能够理解任务何时开始、何时结束,并能精准定位关键事件发生的时刻,标志着对进度理解能力的一次跃迁。

此外,我们还引入了多机器人协作。这使不同类型的机器人能够相互通信并协同工作,解决单个机器人无法独立完成的复杂工作流。

为任何机器人快速适配本地运行模型

许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 正是为应对这些限制而构建——它是我们最高效的视觉-语言-动作模型(VLA),专为在机器人设备本地运行而优化。

该模型原生支持多本体,并继承了我们在 Gemini Robotics 1.5 中先进的“动作迁移”技术。现在,我们只需几个小时的适配时间,通常少于 200 个示例,就能将其适配到新的双臂机器人本体。即使面对形状、传感器和自由度差异巨大的新本体,这一方法依然有效,如下图所示,Dexmate、SO101 和 Trossen 平台正在执行多样化任务。

推进我们对安全且负责任机器人技术的承诺

安全是我们机器人研究的基础。随着机器人获得更强的物理能力,我们致力于确保端到端的安全与对齐。每一次发布,我们都采用多层次方法,将传统物理安全措施与稳健的 AI 安全框架结合起来。

Gemini Robotics 2 专门推进了机器人在应对现实世界不确定性以及与人类协作时的安全性。

我们正在推出 ASIMOV-Agentic,这是一个用于智能体安全编排和不确定性消解的新基准。例如,它衡量