跳转到内容
主站 新闻 控制台

Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作赋能机器人技术

· DeepMind
DeepMind

2026年7月30日

Gemini Robotics ER 2 代表着机器人能力的一次重大跃迁:通过视频理解、任务编排和多机器人协作,为机器人赋能,使其能够更好地帮助人类应对现实世界中的各种任务。

Steven Hansen
高级软件工程师

Peng Xu
软件工程师

要让机器人在日常环境中协助人类,仅具备准确的空间推理能力还不够。机器人还必须快速思考,让决策和推理的节奏跟上现实世界的实时速度。

因此,我们今天推出了 Gemini Robotics ER 2,这是我们目前能力最强的机器人“具身推理”(embodied reasoning)模型。可以将 Gemini Robotics ER 2 视为机器人的高层大脑。它能够让机器人与人类对话、理解物理世界并规划多步骤任务,随后将运动执行交给任意指定的低层视觉-语言-动作(Vision-Language-Action,VLA)模型。Gemini Robotics ER 2 还能够原生调用 Google 搜索等工具,或调用用户自定义的其他函数。Gemini Robotics ER 2 的设计允许机器人在执行动作的同时思考下一步该做什么。

与 Gemini Robotics ER 1.6 相比,Gemini Robotics ER 2 实现了显著升级。通过观察连续的视频流,机器人现在能够跟踪自身进度,在出现问题时进行调整,并准确判断何时进入下一步。我们还引入了多机器人协作能力,使机器人能够在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流。

Gemini Robotics ER 2 现已通过 Gemini API 和 Google AI Studio 面向开发者公开提供,并在 Gemini Enterprise Agent Platform 上以私有预览版提供。为了帮助开发者快速上手,我们分享了相关示例,展示如何配置模型,并通过提示词让它支持更实用的物理 AI 任务。

推进物理智能体能力

现实世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一种物理智能体,能够为机器人编排各个步骤,帮助机器人自我纠错,并泛化到更多新颖场景。为了构建智能体系统,开发者可以将低层控制接口——例如视觉-语言-动作(Vision-Language-Action,VLA)模型或导航 API——声明为工具,并将多模态视频、音频或文本直接流式传输给模型。

Gemini Robotics ER 2 改进了工具编排工作流。我们可以在仿真环境中使用真实世界的机器人控制来评估其性能,甚至可以将它与远程操控机器人的人类操作员结合使用。

Gemini Robotics ER 2 在三种控制模式下的工具编排表现均稳定优于 ER 1.6:真实 VLA、仿真 VLA 和人类远程操作。

在机器人技术中,高层推理依赖于执行速度。Gemini Robotics ER 2 集成了 Gemini Live API,通过针对延迟敏感型任务优化的双向流式端点运行。由此实现了流畅的编排:Gemini Robotics ER 2 可以指挥动作模型和机器人 API 完成多步骤任务,而不会出现令人不适的“停下来思考”式卡顿。

为了展示这一点,我们与合作伙伴 Boston Dynamics 搭配其 Spot 机器人构建了一个演示。我们使用 Gemini Robotics ER 2 编排 Spot API,包括导航和机械臂移动等功能,从而打造出一台能够根据交互指令为你取来物品的机器人。

Gemini Robotics ER 2 驱动 Boston Dynamics Spot,根据自然语言指令取来爆米花零食。

相关代码及其他示例已发布在 GitHub。

释放时间智能,实现稳健的任务完成

机器人技术面临的最大挑战之一,是判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度跟踪方面实现了重大跃迁,能够验证复杂任务——例如拧紧灯泡或系好垃圾袋——是否已按要求完成,然后再切换到下一项任务。

在此次更新中,我们进一步推进了任务进度理解的两项基础能力:进度分类和关键时刻定位。

连续进度分类

进度分类是指机器人跟踪任务完成进度的能力。在我们的评测中,我们将视频流中的每一帧划分为五个进度等级:0%–20%、20%–40%、40%–60%、60%–80% 和 80%–100%。通过量化任务进度,Gemini Robotics ER 2 能够为机器人提供实时态势感知,使其可以动态调整动作,或在步骤失败时重试,而无需重新启动整个工作流。

Gemini Robotics ER 2 在进度分类任务中达到了 57.4% 的准确率,超过了上一代模型和其他竞品前沿模型。

精确定位关键时刻

关键时刻定位用于衡量模型识别关键事件发生所在确切视频帧的能力,例如判断何时停止向杯中倒咖啡。Gemini Robotics ER 2 在关键时刻定位方面实现了显著性能提升,使机器人能够精准地在任务之间切换、验证任务是否成功,并提出纠正措施。

对于关键时刻定位任务,Gemini Robotics ER 2 达到了 91.3% 的准确率,平均绝对距离为 0.96 秒。它的表现接近规模大得多的模型类别,但计算成本仅为后者的一小部分,执行速度却达到 4 倍——亚秒级延迟正是机器人在现实世界中安全运行所实际需要的能力。

多机器人协作

没有任何一款机器人能够适应所有任务——轮式机器人擅长室内环境,而人形机器人可能更适合应对崎岖地形。Gemini Robotics 2 支持多机器人协作,让不同类型的机器能够通过共享的语义理解进行通信、交接任务并完成复杂工作。了解 Gemini Robotics ER 2 如何赋能 Apptronik 的 [Apollo 2](https://apptron…