2026年7月30日
Gemini Robotics ER 2 は、ロボットの能力における大きな飛躍をもたらします。動画理解、タスクのオーケストレーション、複数ロボットの協調を通じてロボットに新たな能力を与え、現実世界のさまざまなタスクに、より効果的に対応して人間を支援できるようにします。
Steven Hansen
シニアソフトウェアエンジニア
Peng Xu
ソフトウェアエンジニア

ロボットが日常の環境で人間を支援するには、正確な空間推論能力を備えているだけでは不十分です。現実世界のリアルタイムな速さに合わせて意思決定と推論を行えるよう、ロボットは素早く思考する必要があります。
そこで本日、Gemini Robotics ER 2 を発表します。これは、現在提供している中で最も高性能なロボット向け「具現化推論(embodied reasoning)」モデルです。Gemini Robotics ER 2 は、ロボットの高次の頭脳と考えることができます。ロボットが人間と対話し、物理世界を理解し、複数のステップからなるタスクを計画できるようにしたうえで、動作の実行を任意に指定した低レベルの視覚・言語・動作(Vision-Language-Action、VLA)モデルに任せることができます。また、Gemini Robotics ER 2 は Google 検索などのツールや、ユーザーが定義したその他の関数をネイティブに呼び出すことも可能です。さらに、動作を実行しながら次に何をすべきかを考えられるよう設計されています。
Gemini Robotics ER 1.6 と比較して、Gemini Robotics ER 2 では大幅なアップグレードを実現しました。ロボットは連続する動画ストリームを観察することで、自身の進捗を追跡し、問題が発生した際に調整を行い、次のステップに移るタイミングを正確に判断できるようになりました。また、複数ロボットの協調機能も導入しました。これにより、ロボットは共有空間内で協力し、1台のロボットだけでは実行できない複雑なワークフローを完了できます。
Gemini Robotics ER 2 は、Gemini API および Google AI Studio を通じて開発者に一般公開されています。また、Gemini Enterprise Agent Platform ではプライベートプレビュー版として提供されています。開発者がすぐに使い始められるよう、モデルの設定方法や、プロンプトによってより実用的なフィジカル AI タスクに対応させる方法を紹介するサンプルも公開しています。
フィジカルエージェントの能力を強化
現実世界のタスクの多くは複雑で、完了するには複数のステップが必要です。Gemini Robotics ER 2 は、ロボットの各ステップをオーケストレーションし、ロボット自身によるエラー修正を支援し、未知のさまざまな状況にも汎化できるフィジカルエージェントです。エージェントシステムを構築する際、開発者は視覚・言語・動作(Vision-Language-Action、VLA)モデルやナビゲーション API などの低レベル制御インターフェースをツールとして宣言し、マルチモーダルな動画、音声、テキストをモデルに直接ストリーミングできます。
Gemini Robotics ER 2 では、ツールのオーケストレーションワークフローを改善しました。シミュレーション環境で実際のロボット制御を用いて性能を評価できるだけでなく、遠隔操作でロボットを操縦する人間のオペレーターと組み合わせて使用することもできます。
Gemini Robotics ER 2 は、3つの制御モード(実機 VLA、シミュレーション VLA、人間による遠隔操作)のすべてにおいて、ER 1.6 を安定して上回るツールオーケストレーション性能を発揮します。

ロボット工学では、高次の推論は実行速度に依存します。Gemini Robotics ER 2 は Gemini Live API と統合されており、レイテンシーが重要なタスク向けに最適化された双方向ストリーミングエンドポイント上で動作します。これにより、スムーズなオーケストレーションが可能になります。Gemini Robotics ER 2 は、動作モデルやロボット API に複数ステップのタスクを実行させながら、不自然な「停止して考える」ような中断を発生させずに指示できます。
この機能を紹介するため、Boston Dynamics と協力し、同社の Spot ロボットを使ったデモを構築しました。Gemini Robotics ER 2 で、ナビゲーションやマニピュレーターの移動などを含む Spot API をオーケストレーションし、対話による指示に応じて物品を取ってきてくれるロボットを実現しました。
Gemini Robotics ER 2 を搭載した Boston Dynamics Spot が、自然言語の指示に従ってポップコーンのスナックを取ってきます。
関連するコードやその他のサンプルは GitHub で公開しています。
時間を理解する能力を引き出し、タスクを確実に完了
ロボット工学における最大の課題の1つは、タスクがいつ完了したかを判断することです。Gemini Robotics ER 2 は、動画理解と進捗追跡において大きな飛躍を遂げました。電球を締める、ゴミ袋をしっかり結ぶといった複雑なタスクが要求どおり完了したかを検証し、その後で次のタスクに移ることができます。
今回のアップデートでは、タスクの進捗を理解するための2つの基盤能力、進捗分類と重要な瞬間の特定をさらに強化しました。
連続的な進捗分類
進捗分類とは、ロボットがタスクの完了状況を追跡する能力です。評価では、動画ストリームの各フレームを、0%~20%、20%~40%、40%~60%、60%~80%、80%~100%の5段階に分類しました。タスクの進捗を定量化することで、Gemini Robotics ER 2 はロボットにリアルタイムの状況認識を提供できます。これにより、ロボットは動作を動的に調整したり、ステップに失敗した際に再試行したりでき、ワークフロー全体を最初からやり直す必要がありません。
Gemini Robotics ER 2 は進捗分類タスクで57.4%の精度を達成し、前世代モデルやその他の最先端競合モデルを上回りました。

重要な瞬間を正確に特定
重要な瞬間の特定は、コップにコーヒーを注ぐのをいつ止めるべきかを判断する場合のように、重要なイベントが発生した正確な動画フレームをモデルが特定する能力を測定するものです。Gemini Robotics ER 2 は、重要な瞬間の特定において大幅な性能向上を実現しました。これにより、ロボットはタスク間を正確に切り替え、タスクが成功したかを検証し、修正措置を提案できるようになります。
重要な瞬間の特定タスクでは、Gemini Robotics ER 2 は91.3%の精度を達成し、平均絶対距離は0.96秒でした。はるかに大規模なモデルクラスに近い性能を発揮しながら、計算コストはその一部に過ぎず、実行速度は4倍に達します。サブ秒レベルのレイテンシーこそ、ロボットが現実世界で安全に動作するために実際に必要とされる能力です。

複数ロボットの協調
あらゆるタスクに対応できるロボットは存在しません。車輪型ロボットは屋内環境を得意とする一方、人型ロボットは起伏の多い地形への対応に適している可能性があります。Gemini Robotics 2 は複数ロボットの協調をサポートしており、異なる種類の機械が共有された意味理解を通じて通信し、タスクを引き継ぎ、複雑な作業を完了できるようにします。Apptronik の [Apollo 2](https://apptron…