2026年7月30日 モデル
Carolina Parada
足元から指先まで——私たちは、幅広く複雑なタスクを遂行できるよう、ロボットに知的な全身制御、高度で繊細な器用操作、そしてチームワークを教えています。
私たちは何十年もの間、ロボットが私たちの世界にシームレスに溶け込み、人間を真の意味で支援できるようになることを夢見てきました。そして今、そのビジョンは重要な一歩を踏み出します。
ほとんどのロボットは、限定的で反復的な作業フロー向けにあらかじめプログラムされているか、遠隔操作されています。予測できない環境に対して、自律的に学習したり適応したりする能力はありません。さらに、あるロボット本体で学習したスキルを、別のロボット本体へ移行することも依然として非常に困難です。最も難しい課題を大規模に解決するには、さまざまな形状やサイズのロボットに、知的に思考し、行動し、相互作用しながら安全にタスクを遂行できる AI モデルを搭載する必要があります。
Gemini Robotics によって、Gemini のマルチモーダルな理解能力が、現実世界での行動をどのように駆動できるかを示してきました。そして本日、次世代の真に適応可能なロボットのためのインテリジェンスレイヤーとなる Gemini Robotics 2 を発表します。今回、真の意味での第一歩を踏み出すことで、知的な全身制御、高度な器用操作、複数ロボットの協調能力が実現します。
Gemini Robotics 2 は、ロボットの一つひとつの動作を推論できるため、幅広いタスクを可能にします。例えば、人型ロボットに歩行、しゃがむ、体を伸ばす、物体を操作するといった動作をさせ、散らかった部屋を片付けることができます。さらに、ほかのロボットと協力して、より迅速にタスクを完了することも可能です。この強力なインテリジェンスはデバイス上で実行でき、わずか数時間で新しいロボット本体にシームレスに適応できます。
この目標を、次の3つの高性能モデルによって実現しました。
- Gemini Robotics 2:私たちの最先端の視覚・言語・動作モデル(VLA)です。視覚と言語の入力を運動制御へ変換し、ロボットが行動できるようにします。このモデルは、足元から指先まで、人型ロボット全体を制御できます。また、ほかの両腕ロボットも制御可能です。さらに、両手やグリッパーにまったく新しい器用操作能力をもたらします。
- Gemini Robotics ER 2:私たちの最も高性能なエンボディド推論(ER)モデルです。視覚言語モデル(VLM)としてロボットのインテリジェントエージェントの役割を果たし、人間とのコミュニケーション、物理世界の理解、数分間にわたる複数ステップのタスクの計画を可能にします。さらに、ロボット同士を協調させる能力も導入しました。
- Gemini Robotics On-Device 2:ロボットのデバイス上で実行できるよう最適化された、最も効率的な視覚・言語・動作モデル(VLA)です。わずか数時間分のデータによって、新しいロボット本体にも迅速に適応できるようになりました。
Gemini Robotics ER 2 推論モデルは、現在 Google AI Studio で利用できます。また、Gemini Enterprise Agent Platform ではプライベートプレビュー版として提供しています。VLA モデルと On-Device モデルは現在、早期アクセスパートナーに提供されています。これらのモデルをハードウェアに適用する方法の詳細については、開発者向けブログをご覧ください。
人型ロボットを動かす:全身タスクを制御する
世界は人間の動き方に合わせて作られています。私たちは狭く、物が散乱した空間で手を伸ばし、かがみ、バランスを保つ必要があります。これまでのモデルは、人型ロボットの上半身を制御して卓上タスクを実行できました。一方、Gemini Robotics 2 は、物理 AI の対象を全身の動作へと拡張します。
私たちのモデルは初めて、人型ロボット全体を制御し、意図を知的な全身制御へと変換できるようになりました。例えば、Apptronik の Apollo 2 人型ロボットを制御する際、「じょうろを下段の棚にある緑色の箱に入れて」と指示できます。Apollo はこの指示を処理し、テーブルまで歩いて行き、じょうろを持ち上げ、棚のそばまで数歩歩いて、指定された場所に正確にじょうろを置きます。ロボットの動作速度にはまだ改善の余地がありますが、これは全身の協調を必要とする、より複雑な現実世界のタスクに向けた重要な一歩です。
両手とグリッパーに高度な器用操作能力をもたらす
家庭や職場で真に役立つためには、ロボットに繊細で高度な器用操作能力が必要です。Gemini Robotics 2 は、ロボットが多指ハンドを使っている場合でもグリッパーを使っている場合でも、さまざまなエンドエフェクターにまったく新しい物理的な器用さをもたらし、これまで以上に有用なロボットを実現します。
現在、このモデルは Apollo 2 ロボットに搭載された SharpaWave の5本指・22自由度の多指ハンドを制御し、結び目を作ったり、ジッパー付きの袋を閉じたりする繊細な動作を実行できます。また、Franka Duo プラットフォームの標準的な2指平行グリッパーを操作し、ぴったりと詰めて箱詰めするなど、複雑で器用さを要するタスクを実行することも可能です。人間レベルの器用さを実現するため、操作の精度と速度を引き続き向上させていきます。
エージェント推論と複数ロボットの協調によって高度なタスクを実現する
現実世界のタスクの多くは、長い時間をかけて複数のステップを完了する必要があります。この複雑さに対応するため、エンボディド推論(ER)モデルである Gemini Robotics ER 2 がロボットの高レベルな頭脳として機能し、ユーザーの指示を処理して人間とコミュニケーションを取ります。部屋を観察し、タスクの完了に必要な手順を推論し、VLA と連携して動作を実行し、タスクが完了するまで進捗を継続的に追跡します。このアーキテクチャにより、ロボットは複雑な複数ステップのタスクを実行し、途中で失敗した場合には自ら修正し、新しい状況や目標にも汎化できるようになります。
今回のアップデートでは、数分間にわたり、数百回の意思決定を伴う長いタスクシーケンスを、ロボットがより確実に実行できるようにしました。Gemini Robotics ER 2 は、タスクの開始と終了のタイミングを理解し、重要なイベントが発生した瞬間を正確に識別できるようになりました。これにより、進捗の理解能力が大きく向上しています。
さらに、複数ロボットの協調能力も導入しました。異なる種類のロボットがコミュニケーションを取り、協力することで、1台のロボットだけでは完了できない複雑なワークフローを共同で解決できます。
デバイス上のモデルをあらゆるロボットに迅速に適応させる
多くのロボットアプリケーションは、ネットワーク遅延やインターネット接続がない環境で動作する必要があります。Gemini Robotics On-Device 2 は、こうした制約に対応するために特別に設計された、ロボットのデバイス上で実行できるよう最適化された、私たちの最も効率的な視覚・言語・動作モデル(VLA)です。
このモデルは、複数のロボット本体をネイティブにサポートし、Gemini Robotics 1.5で採用した高度な「動作転移」技術を受け継いでいます。現在では、通常200個未満のサンプルを使用し、わずか数時間の適応で、新しい両腕ロボット本体にモデルを適応させることができます。新しいロボットの形状、センサー、自由度が大きく異なる場合でも、この手法は有効です。下図は、Dexmate、SO101、Trossen の各プラットフォームがさまざまなタスクを実行している様子を示しています。
安全で責任あるロボット技術への取り組みを推進する
安全性は、私たちのロボット研究の基盤です。ロボットがより多くの物理的能力を獲得するにつれ、エンドツーエンドで一貫した安全性を確保することに取り組んでいます。新しいバージョンをリリースするたびに、従来の物理的な安全対策と堅牢な AI 安全フレームワークを組み合わせた、多層的なアプローチを採用しています。
Gemini Robotics 2 では、現実世界の不確実性への対応や、人間と協働する際の安全性を特に強化しています。
私たちは、エージェントの安全なオーケストレーションと不確実性の解消のための新しいベンチマーク、ASIMOV-Agenticを公開しました。例えば、3段階の