跳转到内容
主站 新闻 控制台

Gemini Robotics 2 将全身智能带给机器人

· DeepMind
DeepMind

2026年7月30日 模型

Carolina Parada

从脚部到指尖——我们正在教会机器人进行智能的全身控制、精细灵巧操作和团队协作,以完成广泛的复杂任务。

几十年来,我们一直梦想着机器人能够无缝融入我们的世界,真正为人类提供帮助。如今,这一愿景正迈出重要一步。

大多数机器人都是针对狭窄、重复的任务流程进行预编程或远程操控的。它们缺乏真正自主学习或适应不可预测环境的能力。此外,将学到的技能从一种机器人本体迁移到另一种机器人本体上,仍然极其困难。要大规模解决最具挑战性的问题,各种形态和尺寸的机器人都需要 AI 模型赋予它们智能思考、行动和交互的能力,从而安全地完成任务。

借助 Gemini Robotics,我们展示了 Gemini 的多模态理解能力如何驱动现实世界中的行动。今天,我们推出 Gemini Robotics 2——为下一代真正具备适应能力的机器人提供智能层。随着它迈出真正意义上的第一步,这项重大进展将解锁智能全身控制、先进灵巧操作以及多机器人协作能力。

Gemini Robotics 2 能够推理机器人的每一个动作,从而解锁广泛的任务。例如,它可以让人形机器人行走、蹲下、伸展身体并操控物体,清理杂乱的房间。它甚至可以与其他机器人协作,更快地完成任务。而且,这种强大的智能也可以在设备本地运行,并在短短数小时内无缝适配全新的机器人本体。

我们通过三个能力强大的模型实现了这一目标:

  • Gemini Robotics 2:我们最先进的视觉-语言-动作模型(VLA),能够将视觉和语言输入转换为运动控制,使机器人能够采取行动。该模型可以控制完整的人形机器人,从脚部到指尖,也可以控制其他双臂机器人。同时,它还为双手和夹爪带来了全新的灵巧操作能力。
  • Gemini Robotics ER 2:我们能力最强的具身推理(ER)模型。这是一种视觉语言模型(VLM),充当机器人的智能代理,使机器人能够与人类交流、理解物理世界,并规划持续数分钟的多步骤任务。我们还引入了让机器人协同工作的能力。
  • Gemini Robotics On-Device 2:我们最高效的视觉-语言-动作模型(VLA),经过优化,可在机器人设备本地运行。借助少量数小时的数据,该模型现在能够快速适应全新的机器人本体。

Gemini Robotics ER 2 推理模型现已在 Google AI Studio 上提供,并在 Gemini Enterprise Agent Platform 上以私有预览版形式开放。我们的 VLA 和 On-Device 模型现已向早期访问合作伙伴提供。有关如何将这些模型应用于硬件的详细信息,请参阅我们的开发者博客。

让人形机器人动起来:管理全身任务

世界是按照人类的动作方式构建的;我们需要在狭窄、杂乱的空间中伸手、弯腰并保持平衡。此前的模型能够控制人形机器人的上半身来完成桌面任务,而 Gemini Robotics 2 则将物理 AI 扩展到了全身动作。

我们的模型首次能够控制完整的人形机器人,将意图转化为智能的全身控制。例如,在控制 Apptronik 的 Apollo 2 人形机器人时,我们可以让它“把喷壶放进底层架子上的绿色箱子里”。Apollo 会处理这条指令,走到桌边,拿起喷壶,走几步来到架子旁,并将喷壶准确放到目标位置。尽管我们的机器人在运动速度方面仍有提升空间,但这是迈向更复杂现实任务的重要一步——这些任务需要机器人进行全身协调。

为双手和夹爪带来先进的灵巧操作能力

要在家庭和工作场所真正发挥作用,机器人需要具备精细灵巧的操作能力。Gemini Robotics 2 为不同类型的末端执行器解锁了全新的物理灵巧性,无论机器人使用的是机械手还是夹爪,都能比以往更有用。

现在,该模型可以控制 Apollo 2 机器人上的 SharpaWave 五指 22 自由度机械手,完成打结、封闭拉链袋等精细动作。它还可以操作 Franka Duo 平台上的标准双指平行夹爪,执行复杂的灵巧任务,例如紧密装箱。我们将继续提升操作的精度和速度,以实现人类水平的灵巧性。

借助智能体推理和多机器人协作解锁高级任务

大多数现实世界的任务都需要在较长时间内完成多个步骤。为了应对这种复杂性,我们的具身推理(ER)模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责处理用户指令并与人类交流。它会观察房间,推理完成任务所需的步骤,与 VLA 协调执行动作,并持续跟踪进度,直到任务完成。这种架构使机器人能够执行复杂的多步骤任务,在某一步失败时进行自我纠正,并泛化到新的情境和目标。

在此次更新中,我们让机器人能够更可靠地执行持续数分钟、涉及数百次决策的长任务序列。Gemini Robotics ER 2 现在能够理解任务何时开始和结束,并准确识别关键事件发生的时刻,从而使进度理解能力实现了质的飞跃。

此外,我们还引入了多机器人协作能力。不同类型的机器人可以通过交流和协作,共同解决单个机器人无法独立完成的复杂工作流程。

让设备端模型快速适配任何机器人

许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 专门针对这些限制而构建——这是我们最高效的视觉-语言-动作模型(VLA),经过优化,可在机器人设备本地运行。

该模型原生支持多种机器人本体,并继承了我们在 Gemini Robotics 1.5中采用的先进“动作迁移”技术。现在,我们只需数小时的适配时间,通常使用少于 200 个示例,就能让模型适应新的双臂机器人本体。即使新机器人在形状、传感器和自由度方面存在巨大差异,这一方法依然有效。下图展示了 Dexmate、SO101 和 Trossen 平台执行多种任务的情况。

推进我们对安全、负责任机器人技术的承诺

安全是我们机器人研究的基础。随着机器人获得更多物理能力,我们致力于确保端到端的安全性与一致性。每次发布新版本时,我们都会采用分层方法,将传统的物理安全措施与稳健的 AI 安全框架相结合。

Gemini Robotics 2 专门提升了机器人应对现实世界不确定性以及与人类协作时的安全能力。

我们推出了 ASIMOV-Agentic,这是一个用于智能体安全编排和不确定性解决的新基准。例如,它能够衡量经典三级